测序技术与分析课件:老师要求与复习重点¶
对应材料:
课件/7-生物信息学A-测序技术与分析.pptx回放/生物信息学(协和班)第6周星期5第6,7节_笔记.txt回放/生物信息学(协和班)第7周星期5第6,7节_笔记.txt回放/生物信息学(协和班)第13周星期5第6,7节_笔记.txt回放/生物信息学(协和班)第16周星期4第8,9节_笔记.txt
一、总体要求¶
- 这份课件内容很多,但老师真正要求掌握的重点非常集中。
- 不是要求把所有平台原理和所有软件安装命令都背下来。
- 老师更强调:
- 测序基础术语要熟
- 常见平台各自大概特点要会区分
RNA-seq、WES、单细胞这几条主流程必须会- 工具名和分析步骤要能对应
- 题目里一旦让你“论述分析流程”,要能写文字也能画流程图
二、与期末重点的关系¶
- 这一章与期末重点最高度重合,必须优先复习。
- 最后理论课和最后实验课反复点名的核心内容,几乎都集中在这一章:
RNA-seq分析流程WES分析流程WES与RNA-seq的差异Mark Duplicate的作用- 突变检测与注释流程
- 工具名和对应步骤
- 单细胞相关流程
三、必须背熟¶
这些内容要达到“老师随口一问,你能直接说出来”的程度。
1. 基础术语¶
read:测序得到的一条序列读段。R1 / R2:双端测序得到的两端 reads。FASTQ:原始测序数据常见格式,包含序列和质量值。- 参考基因组:如
hg19、hg38。 BAM / SAM:比对结果文件。read count:某个基因上被计到的 reads 数量。- duplicate reads:起止位置完全一致、可能来自扩增重复的 reads。
这些词是后面所有流程题的语言基础,必须熟。
2. 测序平台大框架¶
- 一代测序:
Sanger - 二代测序:
NGS / Illumina - 三代测序:
PacBio、Nanopore
要背到的程度:
Sanger准确率高,是验证突变的“金标准”Illumina是当前最常用主力平台- 三代测序读长长,但各有自己的误差和成本特点
3. RNA-seq 标准分析流程¶
这是最关键、最可能出应用题和流程图题的内容之一。
至少要能顺下来:
- 样本取材
- 测序获得
FASTQ - 拿到
R1 / R2 - 比对到参考基因组
- 得到
BAM / SAM - 统计每个基因的
read count - 构建表达矩阵
- 做差异表达分析
- 做
GO / KEGG - 做可视化
工具最少要配对到这一步:
- 比对:
BWA/Bowtie - 计数:
featureCounts/HTSeq - 差异分析:
DESeq2/edgeR
4. WES 标准分析流程¶
这是和 RNA-seq 并列的期末核心。
至少要能顺下来:
- tumor / normal 样本
- 测序得到
FASTQ - 比对到参考基因组
- 生成
BAM - 标记 duplicate
- 碱基质量值重算/校正
- 变异检测
- 数据库过滤
- 注释
- 关键位点
Sanger验证
工具最少要配对到这一步:
- 比对:
BWA - 变异检测:
Mutect2/VarScan - 注释:
ANNOVAR
5. Panel / WES / WGS 区别¶
这个也很高频,必须会比较。
Panel:只测预设少量位点,成本低,但范围最小WES:测全部外显子,兼顾成本、深度和致病变异信息WGS:测全基因组,范围最大,但相同预算下重点位点深度更难保证
一句话记忆:
Panel最窄WES最实用WGS最全但最贵、最吃深度
6. 单细胞 10x 的 barcode 和 UMI¶
这两个概念必须背熟。
barcode:凝胶珠/细胞的身份证UMI:分子的身份证polyT:和mRNA的poly(A)尾结合
老师要求到的程度:
- 看到题目能解释各自作用
- 能说明为什么单细胞需要
barcode + UMI
四、要理解到会做题¶
这些内容不一定要逐页背诵,但要理解到能做判断题、简答题、应用题。
1. 为什么 RNA-seq 要先比对再计数¶
FASTQ只是短序列片段,不知道属于哪个基因- 只有先比对到参考基因组,才能知道来源位置
- 然后才能统计各基因上的
read counts - 有了表达矩阵,才能做差异分析
2. 为什么 RNA-seq 和 DNA-seq 对 duplicate 的处理不同¶
DNA-seq中完全相同起止位置的 reads 常常提示 PCR 重复RNA-seq中高表达基因本来就可能产生很多相同位置的转录本- 所以不能简单照搬
DNA-seq的去重逻辑
3. 为什么 WES 这么常用¶
- 外显子只占基因组
1%~2% - 但富集了大量致病变异
- 在控制成本的同时,更容易把重点区域测得更深
4. 为什么 WES 结果不能直接完全相信¶
- 测序本身有误差
- 比对有误差
- 变异调用有误差
- 所以要做数据库过滤和注释
- 关键结果最好再做
Sanger验证
5. 为什么单细胞技术有意义¶
- 可以看细胞异质性
- 可以做细胞分群、亚群特征、标志物筛选
- 在肿瘤、发育、免疫等研究里尤其重要
五、会认工具和用途即可¶
这部分一般不要求把命令行和安装步骤背下来,但工具名字要会和环节对应。
1. 质控相关¶
FastQCMultiQCTrim_galore
要求:
- 知道它们用于测序数据质控
- 不要求背命令
2. 比对与比对后文件¶
BWABowtieSAM/BAMQualimap
要求:
- 知道
BWA/Bowtie是比对工具 - 知道
BAM是比对结果文件 - 知道
Qualimap可看覆盖深度等比对质量
3. RNA-seq 分析¶
featureCountsHTSeqDESeq2edgeR
要求:
- 至少能说出它们分别用于计数还是差异分析
4. WES 分析¶
GATKMutect2VarScanANNOVARMutSig
要求:
GATK/Mutect2:找突变ANNOVAR:注释突变MutSig:更偏驱动基因分析
5. 单细胞分析¶
Seurat
要求:
- 知道是单细胞分析常用工具包
- 不要求背所有参数和完整代码
六、可以略放松,不必死背细节¶
这些内容看懂即可,不值得花太多时间死背。
Sanger每一步实验容器操作细节Illumina建库的每一轮化学细节PacBio和Nanopore的物理检测细节flowcell / lane / tile的特别细结构描述GATK下载、环境变量配置、参考文件下载步骤- 各个软件的官网安装页面和命令细节
七、按部分总结掌握程度¶
1. 测序平台原理部分¶
Sanger、Illumina、PacBio、Nanopore- 要求:知道大致原理和优缺点,不要求背全部实验细节
2. 二代测序基础术语部分¶
read、R1/R2、FASTQ、参考基因组、BAM- 要求:必须熟,后面流程题默认你全懂
3. RNA-seq 部分¶
- 要求:必须达到“能画流程图、能口述步骤、能说工具名”的程度
4. 单细胞部分¶
10x、barcode、UMI、Seurat- 要求:核心概念要背,分析大框架要懂,平台细节不必全背
5. Panel/WES/WGS 部分¶
- 要求:必须会比较,容易出选择题、判断题、应用题
6. WES 部分¶
- 要求:必须达到“能描述标准分析框架、知道每步常用工具”的程度
八、最小背诵清单¶
如果时间紧,至少先把下面这些背下来:
FASTQ、read、R1/R2是什么RNA-seq标准流程BWA/Bowtie、featureCounts/HTSeq、DESeq2/edgeR各自干什么barcode和UMI的区别Panel / WES / WGS的区别- 为什么
WES常用 WES标准流程Mark Duplicate的作用Mutect2 / VarScan / ANNOVAR各自干什么- 为什么关键突变还要
Sanger验证
九、最像考试题的部分¶
- “请描述
RNA-seq的分析流程” - “请描述
WES的分析流程” - “说明
WES和RNA-seq在分析思路上的异同” - “解释
barcode和UMI的作用” - “比较
Panel、WES、WGS” - “说明为什么要标记 duplicate、为什么还要注释和验证突变”
十、一句话结论¶
- 这份课件最重要的不是平台历史,而是:
- 测序基础术语
RNA-seq流程WES流程- 单细胞
barcode/UMI Panel/WES/WGS区别-
工具名和步骤的对应关系
-
其中
RNA-seq和WES是这章、也是期末复习中的绝对核心。