蛋白质结构预测与分析课件:老师要求与复习重点¶
对应材料:
课件/8-生物信息学A-蛋白质结构预测与分析.pptx回放/生物信息学(协和班)第8周星期5第6,7节_笔记.txt回放/生物信息学(协和班)第16周星期4第8,9节_笔记.txt
一、总体要求¶
- 这份课件页数很多,但老师真正要求的不是把所有算法推导和工具页面都背下来。
- 老师更强调:
- 结构层次概念要分清
- 一级结构分析要知道能分析什么
- 二级、三级结构预测的基本思路要会概括
- 常用工具名和用途要能对应
- 预测结果只能作为线索,不能直接当证据
二、与期末重点的关系¶
- 这一章与期末重点中等到较高重合,建议认真复习。
- 最后实验课明确提到的重合点有:
- 蛋白质序列特征分析
- 蛋白质理化性质分析
- 蛋白质结构分析
- 蛋白质三维结构可视化
- 它不像
RNA-seq/WES那样是绝对核心大流程题来源,但很容易出: - 选择题
- 判断题
- 名词解释
- 简短应用题
三、必须背熟¶
这些内容要达到“看见题目就能直接说”的程度。
1. 蛋白质结构层次¶
- 一级结构:氨基酸线性排列顺序
- 二级结构:
α螺旋、β折叠、转角、无规则卷曲等局部规则结构 - 三级结构:在二级结构基础上进一步折叠形成的整体三维构象
- 四级结构:多个三级结构单元(亚基)聚集形成的复合物
这几个定义必须分清,最容易出基础概念题。
2. 一级结构分析内容¶
至少要背熟这些分析对象:
pI等电点Mw分子量- 氨基酸组成
- 消光系数
- 稳定系数
- 亲水性 / 疏水性
常见工具:
Expasy
3. 跨膜区与信号肽¶
必须会分清:
TMpred/TMHMM:预测跨膜区SignalP:预测分泌型信号肽,不是泛指所有“信号”蛋白
老师这部分强调到的程度是:
- 知道这些工具在干什么
- 知道预测跨膜区对后续实验设计有帮助
4. 二级结构预测的基本方法类别¶
这些名字要会认、会分类:
Chou-FasmanGOR- 最近邻居法
- 神经网络法
- 基于已有知识的方法
- 混合方法
不要求你把每种方法都完整推导,但至少要知道:
Chou-Fasman:基于氨基酸形成不同二级结构的倾向性,找成核位点并扩展GOR:基于信息论和贝叶斯统计思想- 最近邻居法:相似序列倾向于有相似结构
- 神经网络法:利用已知一级结构和二级结构关系训练模型
5. 三级结构预测的主线¶
这是本章最像流程题的部分,必须熟。
核心主线:
- 给定蛋白序列
- 先去数据库搜有没有相似且已有结构的模板
- 如果有,优先同源建模
- 如果没有理想模板,再考虑穿线法
- 再不行才考虑从头预测
- 得到模型后做可视化和评估
最重要的结论:
- 同源建模是主要方法
- 同源建模准确率最高
- 穿线法次之
- 从头预测最低,也最不常用
6. “预测结构只能作为线索”¶
这句话是老师明确强调的,必须背。
- 预测结构可用于提出功能假设
- 可用于指导后续实验
- 但不能直接把预测结构当成最终证据
这句话很容易变成判断题或应用题结论句。
四、要理解到会做题¶
这些不一定要逐页背细节,但要理解到能答简答和应用题。
1. 为什么先做一级结构分析¶
- 有了氨基酸序列后,先分析理化性质
- 再看跨膜区、信号肽、结构域等
- 这些信息可以帮助推测蛋白所在位置、可能功能和实验设计方向
2. 为什么二级结构预测有意义¶
- 二级结构预测本身不是终点
- 它常常是三级结构预测的重要前置步骤
- 尤其在没有直接模板时,二级结构信息可辅助后续建模
3. 为什么三级结构优先同源建模¶
- 课程的基本原则是:相似序列往往有相似结构
- 如果数据库中已有相似蛋白的结构,就等于已有较可靠模板
- 所以同源建模通常比穿线法和从头预测更稳
4. “30%”这个阈值怎么理解¶
- 老师多次提到:若序列相似度大于
30%,通常更适合同源建模 - 不是绝对铁律,但在考试里可以作为常见经验判断
5. 为什么跨膜区预测对实验有用¶
- 可以判断蛋白哪些区域在膜内、膜外、膜上
- 可帮助设计抗体、截短片段和表达构建
五、会认工具和用途即可¶
这部分通常不要求你背所有界面和参数,但名字要能和用途对应。
1. 一级结构与基础分析¶
ExpasyTMpredTMHMMSignalP
2. 二级结构预测¶
CFSSPPSIPREDPHDsec
要求:
- 知道它们是二级结构预测工具
- 不要求背网页按钮和输入界面细节
3. 结构域预测¶
InterProPfam
要求:
- 知道它们用于结构域预测
- 知道保守结构域常提示相似功能
4. 三级结构预测¶
SWISS-MODELiTASSERQUARKROBETTAAlphaFold2
要求:
SWISS-MODEL:同源建模代表工具iTASSER:偏穿线/综合思路QUARK:从头预测ROBETTA:综合法AlphaFold2:当前非常有代表性的结构预测方法
5. 可视化与评估¶
PDBPyMOLVMDVerify3DProcheckWhatcheckErratProve
要求:
PDB是三维结构数据格式PyMOL / VMD是可视化工具- 后面几个是结构评估工具
六、可以略放松,不必死背细节¶
这些部分理解有这个东西即可,不值得花大量时间死背。
Chou-Fasman里所有细节阈值和公式GOR的详细计算过程- 每个在线工具输入界面长什么样
- 结构评估软件每个数值阈值的所有具体标准
- 各种对接软件的操作细节
- 四级结构实验技术的全部列表
七、按部分总结掌握程度¶
1. 结构层次概念¶
- 一级、二级、三级、四级结构
- 要求:必须背熟,能直接定义
2. 一级结构分析¶
- 理化性质、跨膜区、信号肽
- 要求:知道分析什么、用什么工具、结果有什么意义
3. 二级结构预测¶
- 方法类别和大致思想
- 要求:重理解,不重推导
4. 三级结构预测¶
- 同源建模、穿线法、从头预测
- 要求:必须掌握主流程和优先级
5. 结构域与功能推断¶
InterPro、Pfam- 要求:知道保守结构域可提示功能
6. 可视化与评估¶
PDB、PyMOL、VMD以及常见评估工具- 要求:知道用途即可
八、最小背诵清单¶
如果时间不够,至少先把下面这些背下来:
- 一级、二级、三级、四级结构分别是什么
Expasy、TMHMM、SignalP各自做什么- 二级结构基本类型有哪些
Chou-Fasman、GOR、神经网络法的大致区别- 为什么二级结构预测只是三级结构预测的基础
- 同源建模、穿线法、从头预测的先后关系
- 序列相似度大于
30%时为什么更适合同源建模 InterPro、Pfam做什么PDB、PyMOL、VMD做什么- “预测结构只能作为线索,不能直接作为证据”
九、最像考试题的部分¶
- “蛋白质一级、二级、三级、四级结构分别是什么”
- “说明跨膜区预测和信号肽预测的作用”
- “简述二级结构预测的常见方法”
- “给定一条蛋白序列,说明如何预测其三级结构”
- “为什么三级结构预测优先同源建模”
- “为什么预测得到的蛋白结构不能直接当作证据”
十、一句话结论¶
- 这份课件最重要的不是把每个算法公式背下来,而是:
- 结构层次概念要清楚
- 一级结构分析要会
- 二级结构预测思想要懂
- 三级结构预测主流程要会说
- 工具名和用途要能对上
- 预测结构只能作线索这一点一定要记住