跳转至

蛋白质结构预测与分析课件:老师要求与复习重点

对应材料:

  • 课件/8-生物信息学A-蛋白质结构预测与分析.pptx
  • 回放/生物信息学(协和班)第8周星期5第6,7节_笔记.txt
  • 回放/生物信息学(协和班)第16周星期4第8,9节_笔记.txt

一、总体要求

  • 这份课件页数很多,但老师真正要求的不是把所有算法推导和工具页面都背下来。
  • 老师更强调:
  • 结构层次概念要分清
  • 一级结构分析要知道能分析什么
  • 二级、三级结构预测的基本思路要会概括
  • 常用工具名和用途要能对应
  • 预测结果只能作为线索,不能直接当证据

二、与期末重点的关系

  • 这一章与期末重点中等到较高重合,建议认真复习。
  • 最后实验课明确提到的重合点有:
  • 蛋白质序列特征分析
  • 蛋白质理化性质分析
  • 蛋白质结构分析
  • 蛋白质三维结构可视化
  • 它不像 RNA-seq/WES 那样是绝对核心大流程题来源,但很容易出:
  • 选择题
  • 判断题
  • 名词解释
  • 简短应用题

三、必须背熟

这些内容要达到“看见题目就能直接说”的程度。

1. 蛋白质结构层次

  • 一级结构:氨基酸线性排列顺序
  • 二级结构:α 螺旋、β 折叠、转角、无规则卷曲等局部规则结构
  • 三级结构:在二级结构基础上进一步折叠形成的整体三维构象
  • 四级结构:多个三级结构单元(亚基)聚集形成的复合物

这几个定义必须分清,最容易出基础概念题。

2. 一级结构分析内容

至少要背熟这些分析对象:

  • pI 等电点
  • Mw 分子量
  • 氨基酸组成
  • 消光系数
  • 稳定系数
  • 亲水性 / 疏水性

常见工具:

  • Expasy

3. 跨膜区与信号肽

必须会分清:

  • TMpred / TMHMM:预测跨膜区
  • SignalP:预测分泌型信号肽,不是泛指所有“信号”蛋白

老师这部分强调到的程度是:

  • 知道这些工具在干什么
  • 知道预测跨膜区对后续实验设计有帮助

4. 二级结构预测的基本方法类别

这些名字要会认、会分类:

  • Chou-Fasman
  • GOR
  • 最近邻居法
  • 神经网络法
  • 基于已有知识的方法
  • 混合方法

不要求你把每种方法都完整推导,但至少要知道:

  • Chou-Fasman:基于氨基酸形成不同二级结构的倾向性,找成核位点并扩展
  • GOR:基于信息论和贝叶斯统计思想
  • 最近邻居法:相似序列倾向于有相似结构
  • 神经网络法:利用已知一级结构和二级结构关系训练模型

5. 三级结构预测的主线

这是本章最像流程题的部分,必须熟。

核心主线:

  1. 给定蛋白序列
  2. 先去数据库搜有没有相似且已有结构的模板
  3. 如果有,优先同源建模
  4. 如果没有理想模板,再考虑穿线法
  5. 再不行才考虑从头预测
  6. 得到模型后做可视化和评估

最重要的结论:

  • 同源建模是主要方法
  • 同源建模准确率最高
  • 穿线法次之
  • 从头预测最低,也最不常用

6. “预测结构只能作为线索”

这句话是老师明确强调的,必须背。

  • 预测结构可用于提出功能假设
  • 可用于指导后续实验
  • 但不能直接把预测结构当成最终证据

这句话很容易变成判断题或应用题结论句。

四、要理解到会做题

这些不一定要逐页背细节,但要理解到能答简答和应用题。

1. 为什么先做一级结构分析

  • 有了氨基酸序列后,先分析理化性质
  • 再看跨膜区、信号肽、结构域等
  • 这些信息可以帮助推测蛋白所在位置、可能功能和实验设计方向

2. 为什么二级结构预测有意义

  • 二级结构预测本身不是终点
  • 它常常是三级结构预测的重要前置步骤
  • 尤其在没有直接模板时,二级结构信息可辅助后续建模

3. 为什么三级结构优先同源建模

  • 课程的基本原则是:相似序列往往有相似结构
  • 如果数据库中已有相似蛋白的结构,就等于已有较可靠模板
  • 所以同源建模通常比穿线法和从头预测更稳

4. “30%”这个阈值怎么理解

  • 老师多次提到:若序列相似度大于 30%,通常更适合同源建模
  • 不是绝对铁律,但在考试里可以作为常见经验判断

5. 为什么跨膜区预测对实验有用

  • 可以判断蛋白哪些区域在膜内、膜外、膜上
  • 可帮助设计抗体、截短片段和表达构建

五、会认工具和用途即可

这部分通常不要求你背所有界面和参数,但名字要能和用途对应。

1. 一级结构与基础分析

  • Expasy
  • TMpred
  • TMHMM
  • SignalP

2. 二级结构预测

  • CFSSP
  • PSIPRED
  • PHDsec

要求:

  • 知道它们是二级结构预测工具
  • 不要求背网页按钮和输入界面细节

3. 结构域预测

  • InterPro
  • Pfam

要求:

  • 知道它们用于结构域预测
  • 知道保守结构域常提示相似功能

4. 三级结构预测

  • SWISS-MODEL
  • iTASSER
  • QUARK
  • ROBETTA
  • AlphaFold2

要求:

  • SWISS-MODEL:同源建模代表工具
  • iTASSER:偏穿线/综合思路
  • QUARK:从头预测
  • ROBETTA:综合法
  • AlphaFold2:当前非常有代表性的结构预测方法

5. 可视化与评估

  • PDB
  • PyMOL
  • VMD
  • Verify3D
  • Procheck
  • Whatcheck
  • Errat
  • Prove

要求:

  • PDB 是三维结构数据格式
  • PyMOL / VMD 是可视化工具
  • 后面几个是结构评估工具

六、可以略放松,不必死背细节

这些部分理解有这个东西即可,不值得花大量时间死背。

  • Chou-Fasman 里所有细节阈值和公式
  • GOR 的详细计算过程
  • 每个在线工具输入界面长什么样
  • 结构评估软件每个数值阈值的所有具体标准
  • 各种对接软件的操作细节
  • 四级结构实验技术的全部列表

七、按部分总结掌握程度

1. 结构层次概念

  • 一级、二级、三级、四级结构
  • 要求:必须背熟,能直接定义

2. 一级结构分析

  • 理化性质、跨膜区、信号肽
  • 要求:知道分析什么、用什么工具、结果有什么意义

3. 二级结构预测

  • 方法类别和大致思想
  • 要求:重理解,不重推导

4. 三级结构预测

  • 同源建模、穿线法、从头预测
  • 要求:必须掌握主流程和优先级

5. 结构域与功能推断

  • InterProPfam
  • 要求:知道保守结构域可提示功能

6. 可视化与评估

  • PDBPyMOLVMD 以及常见评估工具
  • 要求:知道用途即可

八、最小背诵清单

如果时间不够,至少先把下面这些背下来:

  1. 一级、二级、三级、四级结构分别是什么
  2. ExpasyTMHMMSignalP 各自做什么
  3. 二级结构基本类型有哪些
  4. Chou-FasmanGOR、神经网络法的大致区别
  5. 为什么二级结构预测只是三级结构预测的基础
  6. 同源建模、穿线法、从头预测的先后关系
  7. 序列相似度大于 30% 时为什么更适合同源建模
  8. InterProPfam 做什么
  9. PDBPyMOLVMD 做什么
  10. “预测结构只能作为线索,不能直接作为证据”

九、最像考试题的部分

  • “蛋白质一级、二级、三级、四级结构分别是什么”
  • “说明跨膜区预测和信号肽预测的作用”
  • “简述二级结构预测的常见方法”
  • “给定一条蛋白序列,说明如何预测其三级结构”
  • “为什么三级结构预测优先同源建模”
  • “为什么预测得到的蛋白结构不能直接当作证据”

十、一句话结论

  • 这份课件最重要的不是把每个算法公式背下来,而是:
  • 结构层次概念要清楚
  • 一级结构分析要会
  • 二级结构预测思想要懂
  • 三级结构预测主流程要会说
  • 工具名和用途要能对上
  • 预测结构只能作线索这一点一定要记住