跳转至

序列比较课件:老师要求与复习重点

对应材料:

  • 课件/6-生物信息学A-序列比较.pptx
  • 回放/生物信息学(协和班)第5周星期5第6,7节_笔记.txt
  • 回放/生物信息学(协和班)第6周星期5第6,7节_笔记.txt

一、总体要求

  • 这份课件不是要求把每一页工具操作细节都背下来。
  • 老师更强调:
  • 基本概念不能混
  • 常见比对方式要会区分
  • 常见替换矩阵要知道大致原理和使用场景
  • 常见工具名看到后要知道是干什么的
  • 考试层面,这一章更像:
  • 选择题
  • 判断题
  • 概念辨析题
  • 简短应用题

二、必须背熟

这些内容要达到“看见题目能直接说出来”的程度。

1. 相似性 vs 同源性

  • 相似性 similarity:可以用数值表示,是比对结果中相似程度的描述。
  • 同源性 homology:表示是否来源于共同祖先,不能用百分比表示,是一种推论。
  • 关键点:
  • 相似性高,常提示可能同源。
  • 但相似性本身不能直接证明同源。
  • 同源只有“同源/不同源”,不能说“80%同源”。

2. 直系同源 vs 旁系同源

  • 直系同源 ortholog:不同物种之间,由物种分化产生的同源序列。
  • 旁系同源 paralog:由基因复制产生的同源序列。
  • 这是老师反复讲、期末总重点也明确提到的内容,必须会判断例子。

3. 全局比对 vs 局部比对

  • 全局比对:比较两条序列全长。
  • 局部比对:只找最相似、最保守的局部片段。
  • 要会判断:
  • 序列整体很像时,偏向全局比对。
  • 只怀疑有某个保守功能区时,偏向局部比对。

4. 一致度 identity vs 相似度 similarity

  • 一致度:全局比对中完全相同字符数 / 全局比对长度。
  • 相似度:全局比对中相似字符数 / 全局比对长度。
  • 要点:
  • 相似度通常大于等于一致度。
  • 这两个概念老师专门强调“不能混”。

5. gap open vs gap extend

  • gap open:一串 gap 开始的第一个位置的罚分。
  • gap extend:后续连续延长 gap 的罚分。
  • 默认逻辑一般是:
  • gap open 罚分高
  • gap extend 罚分低
  • 你至少要能解释为什么“开一个缺口”比“延长已有缺口”惩罚更大。

三、要理解到会做题

这些不一定逐句背诵,但必须理解到可以做判断题和简答题。

1. 序列比较的目的

  • 根据已知序列推测未知序列的结构和功能
  • 推测序列之间的同源关系
  • 推测进化关系

2. 为什么蛋白序列往往比核酸序列更适合做远缘比较

  • 氨基酸具有理化性质上的相似性。
  • 蛋白质序列通常比核酸序列更保守。
  • 因此远缘物种间,蛋白序列比较常比核酸更有效。

3. 替换矩阵的作用

  • 替换矩阵就是给“匹配/不匹配/相近残基替换”打分的规则。
  • 本质上是把“相似性”变成可计算的得分。
  • 要知道:
  • 核酸序列也有替换矩阵
  • 蛋白序列更常讨论 PAMBLOSUM

4. PAM 和 BLOSUM 的掌握程度

要求不是背公式,而是掌握以下结论:

  • PAM
  • 基于进化模型外推得到
  • 数字小:适合近缘序列
  • 数字大:适合远缘序列
  • BLOSUM
  • 基于真实保守区数据统计得到
  • 总体上更适合局部相似性搜索和生物学关系分析
  • 数字大:适合更相似的序列
  • 数字小:适合更远的序列

最少要记住这几句:

  • PAM 小近大远
  • BLOSUM 大近小远
  • 远缘序列常常更偏向用 BLOSUM

5. 打点法 dot plot

  • 作用:粗略看两条序列哪些区域相似。
  • 局限:只能大致看趋势,不能精确给出正式比对结果。
  • 所以:
  • 打点法适合初看
  • 真正严谨比较还得靠 alignment

四、会认工具和用途即可

这部分一般不用把所有页面操作都背下来,但工具名和用途要对上。

1. 双序列比对

  • EMBL 在线工具
  • 全局比对
  • 局部比对

2. 快速搜库

  • BLAST
  • BLASTp:蛋白搜蛋白库
  • BLASTn:核酸搜核酸库
  • BLASTx:核酸翻译后搜蛋白库
  • tBLASTn:蛋白搜翻译后的核酸库
  • tBLASTx:翻译后的核酸搜翻译后的核酸库

这一块建议至少把 BLASTp / BLASTn / BLASTx 记熟,后两个能认出来最好。

3. 多序列比对与编辑

  • Clustal Omega:多序列比对
  • Jalview:查看、编辑、展示多序列比对结果

4. 保守区与 motif

  • WebLogo:做 sequence logo,展示各位置保守性
  • MEME:寻找 motif

要知道:

  • sequence logo 是保守性可视化
  • motif 是有功能意义的特定模式序列片段

五、可以略放松,不必死背细节

这些内容理解存在即可,不值得花大量时间背诵。

  • PAM1 如何一步步自乘得到 PAM250 的推导细节
  • 各种在线工具页面按钮位置
  • 公式级别的动态规划展开过程
  • 每个工具输出页面长什么样

六、按部分总结掌握程度

1. 概念部分

  • 相似性、同源性、直系同源、旁系同源
  • 要求:必须背熟,能直接定义,能判断例子

2. 比对方式部分

  • 全局比对、局部比对、打点法
  • 要求:理解到能举例说明什么时候用哪种

3. 打分部分

  • 替换矩阵、identity/similaritygap open/gap extend
  • 要求:必须理解,核心结论要会背

4. PAM/BLOSUM 部分

  • 要求:不背数学推导,但一定要会比较两者原理、数字含义和适用场景

5. 工具部分

  • BLASTClustal OmegaJalviewWebLogoMEME
  • 要求:看到名字知道干什么,不要求死背操作细节

七、最小背诵清单

如果时间不够,至少先把下面这些背下来:

  1. 相似性和同源性的区别
  2. 直系同源和旁系同源的区别
  3. 全局比对和局部比对的区别
  4. 一致度和相似度的区别
  5. gap opengap extend 的含义
  6. PAM 小近大远
  7. BLOSUM 大近小远
  8. BLASTp / BLASTn / BLASTx 分别做什么
  9. Clustal OmegaJalviewWebLogoMEME 的用途
  10. motif 和保守区是什么意思

八、与期末重点的关系

  • 这一章与期末重点高度重合,建议优先复习。
  • 最重合的部分是:
  • 同源关系判断
  • 直系同源/旁系同源区分
  • 工具名与分析用途对应
  • 应用题中“如何通过序列比较推断功能/同源/保守区”的思路
  • 这章不像 RNA-seq/WES 那样偏流程图大题,但它非常容易以选择、判断、概念辨析和小应用题形式出现。