生物统计学思考与练习:参考答案¶
根据《生物统计学思考与练习-参考答案-20251121.pdf》整理。内容按照章节、题型和解题步骤重新编排,便于复习与检索。
使用说明
本文尽可能保留原资料中的题目、选项、数据和参考答案,仅供复习。原资料存在少量题干、选项编号或公式笔误,本文对明显的排版错误作了校正,并在有必要处保留说明;计算结果仍建议结合教材或统计软件复核。
第一章 绪论¶
一、名词解释¶
- 总体:根据研究目的确定的同质研究单位的全体,如某省 2000 年 14 岁男孩的身高。
- 样本:从总体中按照随机化原则抽出的部分观察单位的某种变量集合。
- 变异:同质研究单位中变量值间的差异,来源于各种不可控因素。
- 概率与频率:概率是随机事件发生可能性的大小;频率是多次试验中某事件出现的比例。试验次数充分大时,频率趋近于概率。
- 抽样误差:由于抽样造成的样本统计量与总体参数之间的差别。抽样误差不可避免,但可通过增加样本量减小。
- 参数:由总体个体值计算得出的特征量,一般用希腊字母表示。
- 统计量:由样本数据计算得出的特征量,一般用拉丁字母表示,用于估计总体参数。
- 随机变量:在随机试验中取值不确定、结果由偶然因素决定的变量。
二、简答题¶
1. 试述医学统计学的研究步骤¶
- 设计:科学、周密的研究设计是成败的关键。
- 收集:准确、可靠地获取资料,如统计报表、记录、调查或实验资料。
- 整理:清理、录入和检查数据,进行统计描述与推断。
- 分析:根据资料性质和研究目的选择合适的统计方法。
- 解释与结论:结合研究背景合理解释结果,得出科学结论并报告。
2. A、B 两种药物治疗同一种疾病的有效率分别为 90%、70%,能否认为 A 药有效率高于 B 药¶
不能仅凭两个样本有效率的差异下结论。还需要明确样本量,并进行假设检验,如两独立样本率比较的 χ² 检验或 Z 检验。只有差异具有统计学意义(如 \(P < 0.05\))时,才能认为 A 药的有效率显著高于 B 药。
3. 如何理解“统计学并不能证明事物,但它可以进行推断、发现线索、提供信息,使人们据此改善事物”¶
统计学的根本任务是通过样本数据认识总体规律,但它所提供的是概率意义上的推断,而不是绝对的因果证明。由于研究中不可避免地存在随机误差和抽样误差,统计结论通常只能说明“差异具有统计学意义”或“存在相关性”,不能简单断言因果关系。
统计学能够量化不确定性,并通过合理的研究设计和数据分析,从复杂数据中提炼潜在规律。例如,统计学方法揭示了吸烟与肺癌之间的强相关性;这一发现本身没有直接证明因果关系,却为后续机制研究和公共卫生政策提供了重要线索。
因此,统计学可以帮助研究者建立假设、发现问题并提供决策信息,引导进一步实验和实践改进。在医学科研、临床试验和公共卫生决策中,统计学能够帮助人们在不确定条件下作出更科学的判断。
第二章 计量资料的统计描述¶
一、简答题¶
1. 统计描述主要从哪些方面发现和描述数据的基本特征¶
- 集中趋势:描述数据的中心位置,常用算术均数、中位数和几何均数。
- 离散趋势:描述数据的变异程度,常用极差、四分位数间距、方差、标准差和变异系数。
- 分布形态:描述数据是否对称、偏态或具有不同峰态,可通过频数分布图直观观察。
2. 频数分布表的主要用途¶
- 揭示资料的分布类型。
- 描述分布的集中趋势和离散趋势。
- 便于发现某些特大或特小的可疑值。
3. 变异系数与标准差的异同¶
- 相同点:二者都用于描述数据的离散趋势。
- 不同点:标准差是绝对变异指标,单位与原数据相同;变异系数是相对变异指标,没有单位。
- 适用场景:比较单位不同,或均数相差较大的多组数据时,宜使用变异系数。
二、最佳选择题¶
1. 编制频数分布表时,分组数目通常取多少为宜¶
答案:A
- A. 5~15 组
- B. 5~20 组
- C. 10~20 组
- D. 10~30 组
- E. 10~15 组
2. 计算医学参考值范围的最佳方法是¶
答案:E
- A. 正态分布法
- B. 对数分布法
- C. 百分位数法
- D. 频数表法
- E. 根据原始数据的分布形态选择医学参考值范围的计算方法
3. 描述一组偏态分布资料的离散趋势,下列说法正确的是¶
答案:D
- A. 以极差为宜
- B. 以标准差为宜
- C. 以变异系数为宜
- D. 以四分位数间距为宜
- E. 根据资料实际特征进行选择
4. 各观察值均加或减同一个非零数后¶
答案:B
- A. 均数不变,标准差改变
- B. 均数改变,标准差不变
- C. 两者均不变
- D. 两者均改变
- E. 以上都不对
5. 描述偏态分布的集中趋势,下列说法正确的是¶
答案:D
- A. 以均数为宜
- B. 以几何均数为宜
- C. 以中位数为宜
- D. 根据资料实际特征选择相应指标
- E. 以上均不正确
6. 比较两地 14 岁男性少年体重观察值变异程度的大小,最佳指标是¶
答案:E
- A. 标准差
- B. 方差
- C. 极差
- D. 四分位数间距
- E. 变异系数
7. 测量某地接种乙肝疫苗后的抗体滴度,反映平均滴度宜采用¶
答案:C
- A. 均数
- B. 中位数
- C. 几何均数
- D. 最大值
- E. 最小值
8. 某地儿童晨尿尿胆原浓度资料宜采用什么指标描述¶
原题称调查 270 名儿童,数据如下:
| 尿胆原值(μmol/L) | 0.1~ | 0.4~ | 0.7~ | 1.0~ | 1.3~ | 1.6~ | 1.9~ | 2.2~ |
|---|---|---|---|---|---|---|---|---|
| 频数 | 15 | 37 | 63 | 56 | 29 | 20 | 63 | 46 |
答案:B,中位数与四分位数间距。
- A. 均数与标准差
- B. 中位数与四分位数间距
- C. 几何均数与标准差
- D. 均数与四分位数间距
- E. 中位数与标准差
原资料数据提示
原题写“270 名儿童”,但表中频数合计为 329。本文按原表保留,使用前应核对原始题目。
9. 均数与标准差的关系是¶
答案:E
- A. 均数大于标准差
- B. 均数越大,标准差越大
- C. 均数小于标准差
- D. 标准差越大,均数的代表性越好
- E. 标准差越小,均数的代表性越好
三、计算分析题¶
1. 100 名 7 岁男童坐高资料¶
原始数据(cm):
63.8 64.5 66.8 66.5 66.3 68.3 67.2 68.0 67.9 69.7 63.2 64.6 64.8
66.2 68.0 66.7 67.9 68.6 66.8 66.9 63.2 61.1 65.0 65.0 66.4 69.1
66.8 66.4 67.5 68.1 69.7 62.5 64.3 66.3 66.6 67.8 65.9 67.9 65.9
69.8 71.1 70.1 64.9 66.1 67.3 66.8 65.0 65.7 68.4 67.6 69.5 67.5
62.4 62.6 66.5 67.2 64.5 65.7 67.0 65.1 70.0 69.6 64.7 65.8 64.2
67.3 65.0 65.0 67.2 70.2 68.0 68.2 63.2 64.6 64.2 64.5 65.9 66.6
69.2 71.2 68.3 70.8 65.3 64.2 68.0 66.7 65.6 66.8 67.9 67.6 70.4
68.4 64.3 66.0 67.3 65.6 66.0 66.9 67.4 68.5
(1)频数分布
极差:
\(R = max - min = 71.2 - 61.1 = 10.1 cm\)
以 1 cm 为组距分为 11 个组段:
| 组段(cm) | 频数 |
|---|---|
| 61~ | 1 |
| 62~ | 3 |
| 63~ | 4 |
| 64~ | 18 |
| 65~ | 12 |
| 66~ | 20 |
| 67~ | 20 |
| 68~ | 8 |
| 69~ | 8 |
| 70~ | 4 |
| 71~72 | 2 |
| 合计 | 100 |
分布近似正态,呈中间高、两端低的形态。坐高在 66~和 67~组的频数最高,均为 20,向两侧逐渐降低。
(2)集中趋势
- 中位数:66.75 cm
- 均数:66.656 cm
- 几何均数:66.624 cm
数据分布大致对称,三个指标相近。均数利用了全部观察值,推荐用均数描述集中趋势。
(3)离散趋势
- 极差:10.1 cm
- 四分位数间距:\(IQR = Q3 - Q1 = 68 - 65 = 3 cm\)
- 标准差:2.069 cm
数据分布大致对称,标准差利用了全部数据信息,推荐用标准差描述离散趋势。
2. 450 名员工左、右眼裸眼视力¶
| 眼别 | ≤0.5 | 0.6 | 0.7 | 0.8 | 0.9 | 1.0 | 1.1 | ≥1.2 | 合计 |
|---|---|---|---|---|---|---|---|---|---|
| 左眼 | 4 | 18 | 35 | 49 | 78 | 131 | 90 | 45 | 450 |
| 右眼 | 9 | 22 | 42 | 48 | 107 | 93 | 82 | 47 | 450 |
左眼
- 原答案判断分布呈右偏态,峰值位于 1.0 视力组。
- 集中趋势:中位数。
- 离散趋势:四分位数间距。
- 理由:中位数和四分位数间距受极端值影响较小,适于偏态资料。
右眼
- 分布近似对称,峰值位于 0.9 视力组。
- 集中趋势:均数。
- 离散趋势:标准差。
- 理由:均数和标准差利用全部观察值,适于近似对称资料。
3. 1982 年与 2002 年女性月经初潮年龄¶
| 年份 | 9 岁 | 10 岁 | 11 岁 | 12 岁 | 13 岁 | 14 岁 | 15 岁 | 16 岁 | 合计 |
|---|---|---|---|---|---|---|---|---|---|
| 1982 | 2 | 6 | 9 | 11 | 8 | 6 | 7 | 5 | 54 |
| 2002 | 9 | 11 | 12 | 8 | 7 | 3 | 2 | 2 | 54 |
指标计算
| 年份 | 中位数 | 均数 | 几何均数 | 极差 | 四分位数间距 | 标准差 |
|---|---|---|---|---|---|---|
| 1982 | 12 岁 | 12.6 岁 | 12.5 岁 | 7 岁 | 3 岁 | 2.0 岁 |
| 2002 | 11 岁 | 11.4 岁 | 11.2 岁 | 7 岁 | 2.75 岁 | 1.9 岁 |
指标选择
两组数据均呈右偏分布。推荐用中位数描述集中趋势,用四分位数间距描述离散趋势,因为二者对偏态分布和极端值不敏感。
比较
- 2002 年中位数低于 1982 年,提示女性月经初潮年龄提前。
- 2002 年四分位数间距较小,提示初潮年龄变异程度较小、数据更集中。
- 两年数据均呈右偏分布;原答案认为 1982 年偏度更明显,而 2002 年分布更紧凑且整体向左移动。
第三章 计数资料的统计描述¶
一、名词解释¶
- 结构相对数(构成比,proportion):某一组成部分观察单位数与同一事物各组成部分观察单位总数之比,用于说明各部分所占比重,通常用百分数表示。
\(构成比 = 某一组成部分观察单位数 ÷ 各组成部分观察单位总数 × 100%\)
- 强度相对数(率,rate):说明单位时间内某现象发生的频率或强度。
\(率 = 某时期内发生某现象的观察单位数 ÷ 同期可能发生该现象的观察单位总数 × K\)
\(K\) 为比例基数,可取 100、1 000、10 000 或 100 000,使结果分别按百分数、千分数、万分数或十万分数表示。
- 相对比(ratio):两个有关联指标 A 与 B 之比,用于说明两指标间的比例关系。A、B 可以是绝对数、相对数或平均数。
\(比 = A ÷ B\),也可表示为百分数。
- 定基比:报告期指标与基线期指标之比,即 \(a_n / a_0\)。
- 环比:报告期指标与前一期指标之比,即 \(a_n / a_(n-1)\)。
- 平均增长速度:平均发展速度减 100%;平均发展速度是各期发展速度的几何平均数。
二、简答题¶
1. 结构相对数与强度相对数的区别¶
| 比较项目 | 结构相对数 | 强度相对数 |
|---|---|---|
| 定义 | 反映事物内部各组成部分所占比重 | 反映单位时间内某现象发生的频率或强度 |
| 分子与分母 | 分子是分母的一部分 | 分母是可能发生该事件的观察单位总数 |
| 特点 | 各部分构成比之和为 100%,各组成部分相互影响 | 当分母较大时,样本率近似总体率;分母不能包括不可能发生事件的对象 |
2. 发病率与患病率、死亡率与病死率的不同¶
- 发病率的分子是一定时期、一定人群中某病新发生的病例数。
- 患病率的分子是一定时期、一定人群中某病的新旧病例总数。
- 死亡率的分母是同期观察人口数。
- 病死率的分母是同期患该病的患者数。
3. 应用相对数时应注意的问题¶
- 计算相对数,特别是率时,应有足够的观察单位数。
- 合计率应将各组分子、分母分别合计后计算,不能直接平均各组率。
- 不能用结构相对数代替强度相对数。
- 比较资料时应注意可比性。
- 样本相对数的比较应进行假设检验。
4. 辛普森悖论和率的标准化¶
- 辛普森悖论:在某种条件下,分组比较中都占优势的一方,在总体评价中却可能不占优势。
- 率的标准化:先把不同组的内部结构转化为同一标准构成,再在该结构基础上计算和比较合计率,从而消除内部构成不同对合计率的影响。
三、最佳选择题¶
-
下列指标不属于相对数的是(C)
A. 率;B. 构成比;C. 百分位数;D. 相对比。 -
某病患者 1 000 人,其中男性 750 人、女性 250 人,分别占 75% 和 25%,正确结论是(B)
A. 男性易患该病;B. 尚不能得出有关患病情况的结论;C. 女性易患该病;D. 可计算男、女性患病率。 -
某地某年肝炎发病人数占同年传染病人数的 10.1%,该指标是(B)
A. 强度相对数;B. 结构相对数;C. 发病率;D. 期间患病率。 -
计算某地某年肺癌发病率,分母应为(C)
A. 该地体检人数;B. 该地年平均就诊人数;C. 该地年平均人口数;D. 该地平均患者人数。 -
实际工作中容易把构成比当作率,主要原因可能是(C)
A. 构成比比率容易计算;B. 构成比用得较多;C. 计算构成比的原始资料较率容易获得;D. 构成比与率的计算方法一样。 -
下列说法错误的是(B)
A. 计算率时应有足够的观察单位数或观察次数;B. 分析大样本时可以用构成比代替率;C. 应分别合计分子和分母后求合计率;D. 相对数比较应注意可比性。 -
某病某年发病人数为 \(a0\),以后各年为 \(a1, a2, …, an\),年平均增长速度是(D)
A. \((a_n/a_0)^(1/(n-1))\);B. \((a1+a2+…+an)/(n+1)\);C. \((a1×a2×…×an)^(1/n)\);D. \((a_n/a_0)^(1/n)-1\)。 -
定基比和环比属于(A)
A. 相对比;B. 构成比;C. 平均数;D. 强度相对数。 -
比较甲、乙两厂某工种工人某种职业病患病率,对工龄进行标准化的原理是(D)
A. 假设两厂患病工人数相同;B. 假设两厂工人数相同;C. 假设两厂工人数构成相同;D. 假设两厂该工种工人的工龄构成相同。 -
上题标准构成应选择(D)
A. 甲厂工人的年龄构成;B. 乙厂工人的年龄构成;C. 两厂合并工人的年龄构成;D. 两厂合并工人的工龄构成。
四、计算分析题¶
某县 2004 年各年龄组恶性肿瘤死亡情况¶
| 年龄组(岁) | 人口数 | 死亡数 | 死亡构成(%) | 死亡率(1/10 万) |
|---|---|---|---|---|
| 0~ | 356 980 | 11 | 1.52 | 3.08 |
| 15~ | 232 505 | 22 | 3.03 | 9.46 |
| 30~ | 205 032 | 142 | 19.59 | 69.26 |
| 50~ | 121 882 | 443 | 61.10 | 363.47 |
| 70~ | 20 047 | 107 | 14.76 | 533.75 |
| 合计 | 936 446 | 725 | 100.00 | 77.42 |
- \(死亡构成 = 各年龄组死亡数 ÷ 总死亡数 × 100%\)
- \(死亡率 = 各年龄组死亡数 ÷ 各年龄组人口数 × 10⁵\)
该县 2004 年恶性肿瘤死亡率随年龄增长而上升,70 岁及以上组最高,为 533.75/10 万。
第四章 常用概率分布¶
一、简答题¶
1. 正态分布、二项分布和泊松分布的区别与联系¶
区别
- 正态分布:连续型分布,呈钟形、单峰,关于 \(X = μ\) 对称。
- 二项分布:离散型分布;在 \(n\) 重伯努利试验中,事件 A 的发生次数 \(X\) 服从二项分布。
- 泊松分布:离散型分布;描述单位时间或单位空间内稀有事件发生次数的概率分布。
联系
- \(nπ ≥ 5\) 且 \(n(1-π) ≥ 5\) 时,二项分布可近似为正态分布。
- 泊松分布是二项分布的极限:若 \(X ~ B(n, π)\),当 \(π\) 很小、\(n\) 很大时,\(X\) 近似服从均数 \(μ = nπ\) 的泊松分布。
- \(μ ≥ 20\) 时,泊松分布可近似为正态分布。
2. 随机变量服从二项分布和泊松分布的条件¶
二项分布
- 进行相互独立的重复试验。
- 每次试验只有两种可能结果。
- 试验次数 \(n\) 固定。
- 每次试验中事件 A 的发生概率 \(p\) 恒定。
泊松分布
- 各事件的发生相互独立。
- 任意单位时间或空间内的平均发生率恒定。
- 极短时间或极小空间内发生两次及以上事件的概率可忽略不计。
3. 二项分布、泊松分布近似正态分布的条件¶
- 二项分布:\(nπ ≥ 5\) 且 \(n(1-π) ≥ 5\)。
- 泊松分布:\(μ ≥ 20\)。
二、最佳选择题¶
-
正态分布 \(N(μ, σ²)\),当 μ 保持不变、σ 越小时(B)
A. 曲线越矮胖;B. 曲线越瘦高;C. 曲线沿横轴向右移动;D. 曲线沿横轴向左移动;E. 曲线不变。 -
某指标呈正态分布,理论上有多少观察值落在 \(X̄ ± 2.58S\) 范围内(D)
A. 68.27%;B. 90%;C. 95%;D. 99%;E. 45%。 -
标准正态分布曲线下,从 0 到 1.96 的面积是(D)
A. 45%;B. 90%;C. 95%;D. 47.5%;E. 99%。 -
正常人的尿铅含量 X 呈右偏态分布,制定双侧 95% 医学参考值范围宜采用(B)
A. \(X̄ ± 1.96S\);B. \(P2.5~P97.5\);C. \(lg⁻¹(Ȳ+1.64S_Y)\);D. \(lg⁻¹(Ȳ+1.96S_Y)\);E. \(P5~P95\)。 -
样本例数不变时,二项分布越接近对称分布的条件是(D)
A. 总体率 π 越大;B. 样本率 p 越大;C. 总体率 π 越小;D. 总体率 π 越接近 0.5;E. 总体率 π 接近 0.1 或 0.5。 -
铅作业工人血片上点彩红细胞的出现数近似服从(D)
A. 二项分布;B. 正态分布;C. 偏峰分布;D. 泊松分布;E. 对称分布。 -
若随机变量 X 服从泊松分布,其均数 μ 与标准差 σ 的关系是(E)
A. \(μ = σ\);B. \(μ < σ\);C. \(μ > σ\);D. \(μ = σ\);E. \(μ = σ²\)。
三、计算分析题¶
1. 某市 110 名 1 周岁男童身长资料¶
原始数据(cm):
70.9 65.0 76.3 74.2 79.8 74.5 80.5 71.5 78.9 71.5 76.3
66.7 70.8 68.8 77.5 74.5 83.5 82.0 70.9 73.5 77.5 77.5
81.2 77.1 72.3 76.5 74.0 74.3 74.6 72.6 71.3 73.1 78.3
75.4 69.2 70.0 71.9 76.6 78.8 77.2 73.4 68.5 77.6 76.5
75.8 64.8 75.6 80.0 76.6 76.5 77.7 74.1 80.8 70.6 79.2
76.9 70.5 74.2 77.5 76.6 82.3 72.1 69.9 79.5 75.8 76.0
78.6 80.6 75.6 73.3 68.7 74.5 78.5 71.3 72.0 73.2 74.8
68.8 76.0 82.6 69.5 77.5 80.6 81.5 75.1 65.2 68.0 80.8
73.1 66.8 72.9 75.9 72.8 70.5 74.1 74.2 75.7 73.5 73.8
68.2 73.7 84.4 74.8 72.5 74.9 74.9 74.2 73.8 76.2 80.7
(1)身长在 75.0~78.0 cm 内的比例
\(29 / 110 = 26.36%\)
(2)95% 和 99% 医学参考值范围
- 均数:74.77 cm
- 标准差:4.15 cm
- 95% 范围:\(74.77 ± 1.96 × 4.15 = (66.63, 82.90) cm\)
- 99% 范围:\(74.77 ± 2.58 × 4.15 = (64.06, 85.48) cm\)
(3)随机抽查 1 名男童,身长超过 80 cm 的概率
\(Z = (80 - 74.77) / 4.15 = 1.26\)
查标准正态分布表,概率约为 10.37%。
2. 5 名患者服药,至多 2 人发生不良反应¶
已知单人发生肠道不良反应的概率为 10%,令 \(X ~ B(5, 0.1)\):
\(P(X ≤ 2) = P(X=0) + P(X=1) + P(X=2) ≈ 0.99144\)
3. 调查 10 万人,其中恰有 9 人患流行性腮腺炎¶
患病率为 \(10 × 10⁻⁵\),调查人数为 10 万,因此泊松分布参数 \(λ = 10\):
\(P(X=9) = λ⁹e⁻λ / 9! ≈ 0.1251\)
第五章 统计表与统计图¶
一、简答题¶
1. 统计表的基本结构与制表注意事项¶
基本结构:标题、标目、线条、数字和备注等。
注意事项
- 标题应概括表的主要内容,通常在标题前编号;若数值单位相同,可在标题后统一注明。
- 标目应文字简明、层次清楚。
- 线条不宜过多,尤其不能使用竖线和斜线。
- 表中不宜留空格。
- 备注不是统计表的必备内容。
2. 统计图的基本结构与绘图注意事项¶
基本结构:标题、标目、图域和图例。
注意事项
- 根据资料性质和研究目的选择合适的统计图。
- 比较不同事物时,用不同线条、图案或颜色表示,并配图例。
- 同一统计图中的线条和图案不宜过多。
- 条图、直方图的纵轴坐标应从 0 开始。
- 绘制直方图时组距应相等。
二、最佳选择题¶
-
关于统计表制作,错误的是(B)
A. 标题放在表上方;B. 包含的内容越多越好;C. 不用竖线和斜线分隔;D. 表中不应有空格。 -
关于统计图绘制,错误的是(B)
A. 标题放在图下方;B. 线图中的线条越多越好;C. 直条图纵轴必须从零开始;D. 直方图组距必须相等。 -
比较两地 20 年来冠心病和糖尿病发病率的上升速度,宜用(D)
A. 直条图;B. 百分比条图;C. 普通线图;D. 半对数线图。 -
比较某地某病不同证型在不同性别间的构成,宜用(C)
A. 普通线图;B. 直方图;C. 圆图;D. 直条图。 -
描述某年某地非典型性肺炎的年龄分布,宜用(D)
A. 普通线图;B. 圆图;C. 直条图;D. 直方图。
三、计算分析题¶
1. 某地 2009 年前六位死因的死亡率¶
| 死因 | 死亡率(1/10 万) |
|---|---|
| 循环系统疾病 | 266.59 |
| 肿瘤 | 236.67 |
| 呼吸系统疾病 | 75.34 |
| 损伤、中毒 | 40.51 |
| 内分泌营养代谢性疾病 | 31.10 |
| 消化系统疾病 | 20.39 |
不同死因是彼此独立的分类,适合绘制直条图。
2. 某地 2001—2006 年孕产妇死亡率¶
| 年份 | 2001 | 2002 | 2003 | 2004 | 2005 | 2006 |
|---|---|---|---|---|---|---|
| 死亡率(1/10 万) | 8.95 | 9.99 | 11.99 | 10.79 | 1.40 | 8.31 |
资料反映死亡率随时间的变化趋势,适合绘制普通线图。原 PDF 第 17 页给出的折线图以年份为横轴、死亡率为纵轴,变化趋势为先升高、2005 年明显降低、2006 年回升。
第六章 参数估计¶
一、名词解释¶
- 抽样误差:由个体差异产生,并由随机抽样造成的样本统计量与总体参数之间的差异。
- 均数标准误:样本均数的标准差,反映样本均数的抽样误差大小。
- 率的标准误:反映样本率之间的差异,也反映样本率与相应总体率之间的差异。
- 参数估计:利用样本统计量估计总体参数。
- 置信区间:从总体中反复随机抽取相同样本量的样本并计算置信区间,平均有 \(1-α\)(如 95%)的区间包含总体参数。置信区间通常由两个置信限构成。
二、最佳选择题¶
-
减小抽样误差通常可采用(D)
A. 减小样本标准差;B. 增大样本标准差;C. 减小样本含量;D. 增大样本含量。 -
均数标准误反映(D)
A. 个体变异程度;B. 个体集中趋势;C. 样本均数的集中趋势;D. 样本均数与总体均数的差异。 -
关于 t 分布,说法错误的是(C)
A. t 分布图是一簇曲线;B. t 分布是单峰分布;C. 自由度相同时,\(|t|\) 越大,P 越大;D. 自由度趋于无穷时,t 分布趋于标准正态分布。 -
区间 \(p ± 1.96S_p\) 的含义是(B)
A. 95% 的总体率在此范围;B. 总体率的 95% 置信区间;C. 95% 的样本率在此范围;D. 样本率的 95% 置信区间。 -
随机抽取 100 名健康女性,血清总蛋白均数为 74 g/L、标准差为 4 g/L,总体均数的 95% 置信区间计算式为(D)
A. \(74 ± 1.96×4\);B. \(74 ± 2.58×4\);C. \(74 ± 2.58×4÷10\);D. \(74 ± 1.96×4÷10\)。
三、简答题¶
1. 样本均数标准误与样本标准差的区别和联系¶
| 项目 | 样本均数标准误 | 样本标准差 |
|---|---|---|
| 意义 | 反映样本均数的变异程度和抽样误差大小 | 反映样本中个体值的变异程度 |
| 符号 | \(σ_X̄\)、\(S_X̄\) | \(σ\)、\(S\) |
| 计算 | \(σ_X̄ = σ/√n\),\(S_X̄ = S/√n\) | \(σ = √[Σ(X-μ)²/N]\),\(S = √[Σ(X-X̄)²/(n-1)]\) |
| 控制 | 增大样本量可减小标准误 | 由个体差异或自然变异造成,通常无法通过增大样本量消除 |
联系:\(σ_X̄ = σ/√n\),实际工作中用 \(S_X̄ = S/√n\) 估计。
2. t 分布的特点¶
- t 分布是一簇曲线。
- 单峰,以 \(t=0\) 为中心,左右对称。
- 自由度越小,分布越分散、曲线越平坦、尾部越高;自由度越大,分布越集中、曲线越陡峭、尾部越低。
- 自由度趋于无穷时,t 分布趋近标准正态分布。
3. 总体均数置信区间与医学参考值范围的区别¶
- 置信区间:按一定置信度估计总体参数可能所在的范围。
- 医学参考值范围:描述绝大多数正常个体某项指标所在的范围。
四、计算分析题¶
1. 正常人与病毒性肝炎患者血清转铁蛋白¶
| 组别 | 观测值(g/L) |
|---|---|
| 正常人 | 2.65,2.72,2.85,2.91,2.55,2.76,2.82,2.69,2.64,2.73 |
| 患者 | 2.36,2.15,2.52,2.25,2.28,2.31,2.53,2.19,2.34,2.31 |
(1)两组总体均数的 95% 置信区间
正常人:
- 样本均数:2.732 g/L
- 标准差:0.108 g/L
- 标准误:0.034 g/L
- 95% 置信区间:\(X̄ ± t0.975 × S_X̄ = (2.655, 2.809) g/L\)
患者:
- 样本均数:2.324 g/L
- 标准差:0.124 g/L
- 标准误:0.039 g/L
- 95% 置信区间:\(X̄ ± t0.975 × S_X̄ = (2.235, 2.413) g/L\)
(2)两总体均数之差的 95% 置信区间
- 均数差:\(2.732 - 2.324 = 0.408 g/L\)
- 合并方差:\(S_p² = [(n1-1)S1² + (n2-1)S2²] / (n1+n2-2) = 0.0134889\)
- 合并标准差:\(S_p = 0.11614 g/L\)
- 均数差标准误:\(SE_diff = S_p√(1/n1 + 1/n2) ≈ 0.05194\)
- 自由度:\(df = n1 + n2 - 2 = 18\)
- 95% 置信区间:\(0.408 ± t0.975 × 0.05194 = (0.299, 0.517) g/L\)
2. 肾移植患者巨细胞病毒感染率¶
43 例患者中检出 19 例感染:
- 样本感染率:\(p = 19/43 = 0.4419\)
- 率的标准误:\(S_p = √[p(1-p)/n] = 0.0757\)
- 95% 置信区间:\(p ± Z0.025S_p = (29.34%, 59.03%)\)
3. 阴道分娩与剖宫产产后出血率之差¶
| 生产方式 | 总例数 | 出血例数 | 出血率 |
|---|---|---|---|
| 阴道分娩 | 318 | 68 | 21.38% |
| 剖宫产 | 169 | 24 | 14.20% |
- 两样本合计率:\(P_c = (x1+x2)/(n1+n2) = 0.1889\)
- 两样本率差标准误:\(S_(p1-p2) = √[P_c(1-P_c)(1/n1+1/n2)] = 0.03726\)
- 率差的 95% 置信区间:\((p1-p2) ± u_(α/2)S_(p1-p2) = (-0.12%, 14.48%)\)
第七章 计量资料两组均数的比较——t 检验¶
一、名词解释¶
- P 值:在 \(H0\) 成立时,双侧检验中通过抽样获得 \(|t| ≥ t_(α/2,ν)\) 这类结果的概率。P 值不是无效假设成立的概率。
- Ⅰ型错误:\(H0\) 事实上成立,却被错误拒绝;发生概率为 α。
- Ⅱ型错误:\(H0\) 事实上不成立,却未被拒绝;发生概率为 β。
- 检验水准:α,即 \(H0\) 为真时错误拒绝 \(H0\) 的最大允许概率。
- 检验效能:\(1-β\),又称把握度。当总体参数确有差别时,按 α 水准通过假设检验发现差别的概率。
二、简答题¶
1. 假设检验的基本思想与步骤¶
假设检验基于小概率事件和反证法思想,判断样本差异是否具有统计学意义,进而推断样本所来自的总体是否不同。
步骤:
- 建立检验假设,确定检验水准。
- 计算检验统计量。
- 确定 P 值,作出统计推断。
2. 假设检验与置信区间的关系¶
置信区间可以用于回答相应的假设检验问题;假设检验则可给出 P 值等置信区间没有直接提供的信息。二者从不同角度进行统计推断。
三、最佳选择题¶
-
关于假设检验结论,正确的是(C)
A. \(P>α\),拒绝 \(H0\),可能犯Ⅱ型错误;B. \(P<α\),不拒绝 \(H0\),可能犯Ⅱ型错误;C. \(P<α\),拒绝 \(H0\),可能犯Ⅰ型错误;D. \(P>α\),不拒绝 \(H0\),可能犯Ⅰ型错误。 -
两样本均数比较的 t 检验中,\(|t|\) 越大(A)
A. 越有理由拒绝 \(H0\);B. 越有理由不拒绝 \(H0\);C. 两均数差异越大;D. 两均数差异越小。 -
关于单侧检验与双侧检验,下列说法中有几种正确(B,2 种)
①单侧检验比双侧检验更容易得到差异有统计学意义的结论;②想得到有统计学意义的结果就应首选单侧检验;③可在得到 P 值后根据需要选择单侧或双侧检验;④应根据专业知识在研究设计阶段确定单侧或双侧检验。选项:A. 1 种;B. 2 种;C. 3 种;D. 4 种。 -
两类错误的关系是(D)
A. 样本含量确定时,α 增大、β 减小;B. 增大样本含量可同时降低两类错误;C. 欲减小Ⅱ型错误概率,可取较大的 α;D. 上述说法均正确。 -
单样本均数 t 检验的应用前提是(A)
A. 样本来自正态总体;B. 方差齐性;C. 同时满足正态性和方差齐性;D. 任何资料均可。
四、计算分析题¶
1. 新减肥药与常规药对 BMI 的影响¶
试验组(20 人):
疗前:27.1 32.0 30.0 25.6 26.0 28.0 29.0 30.0 32.0 32.0
26.0 27.0 28.0 29.0 30.0 25.0 26.0 29.0 32.0 34.0
疗后:21.0 26.0 26.0 22.0 22.0 24.0 26.0 28.0 28.0 29.0
21.0 23.0 22.0 25.0 27.0 21.0 23.0 25.0 28.0 30.0
对照组(20 人):
疗前:27.5 32.0 30.0 25.5 26.0 28.0 29.0 30.0 31.6 32.0
26.0 27.0 28.0 29.0 30.0 25.0 26.0 29.0 32.0 34.0
疗后:22.0 27.0 27.0 23.0 21.0 25.0 27.0 29.0 27.0 29.0
22.0 25.0 23.0 24.0 29.0 22.0 23.0 23.0 27.0 29.0
(1)两种药物能否改变 BMI:分别进行配对样本 t 检验
试验组:
- \(H0:μd = 0\),服药前后 BMI 相同。
- \(H1:μd ≠ 0\),服药前后 BMI 不同。
- \(α = 0.05,t = 16.946,P < 0.05\)。
- 拒绝 \(H0\),认为减肥新药可以改变 BMI。
对照组:
- \(H0:μd = 0\),服药前后 BMI 相同。
- \(H1:μd ≠ 0\),服药前后 BMI 不同。
- \(α = 0.05,t = 10.838,P < 0.05\)。
- 拒绝 \(H0\),认为常规药物可以改变 BMI。
(2)新药效果是否优于常规药:比较两组 BMI 减少量
- \(H0\):两组 BMI 减少量的总体均数相同。
- \(H1\):两组 BMI 减少量的总体均数不同。
- \(α = 0.05,t = 0.856,P > 0.05\)。
- 不拒绝 \(H0\),两组 BMI 减少量的差异无统计学意义,尚不能认为新药优于常规药。
原答案表述提示
原资料把这一问写为“单侧检验”,但同时把备择假设写成“不等于”,属于双侧形式。本文保留原资料给出的统计量和结论,正式分析时应在研究设计阶段明确检验方向。
2. 高原地区新生儿红细胞含量¶
样本数据(10¹²/L):7.0,6.9,6.8,6.5,6.8,6.1,6.0,7.3,7.2,6.0。一般地区总体均数为 \(6.5×10¹²/L\)。
进行单样本 t 检验:
- \(H0:μ = 6.5\)
- \(H1:μ ≠ 6.5\)
- \(α = 0.05,t = 1.042,P > 0.05\)
不拒绝 \(H0\),高原地区与一般地区新生儿红细胞含量的差异无统计学意义。
第九章 χ² 检验思考与练习¶
原 PDF 没有收录第八章,章节编号直接从第七章跳至第九章。
一、简答题¶
1. χ² 检验的基本原理¶
比较实际观察频数与理论频数的差异,据此判断检验假设是否成立。
2. 四格表资料如何选择检验方法¶
- \(n ≥ 40\) 且所有理论频数 \(T ≥ 5\):普通 χ² 检验。
- \(n ≥ 40\),但存在 \(1 ≤ T < 5\):连续性校正 χ² 检验。
- \(n < 40\) 或存在 \(T < 1\):Fisher 确切概率法。
3. 行×列表 χ² 检验的注意事项¶
- 若 1/5 以上格子的理论频数 \(T < 5\),或存在一个格子 \(T < 1\),应改用 Fisher 确切概率法。
- 多个样本率比较若 \(P < 0.05\),应进一步进行两两比较。
- 单向有序的两组或多组构成比比较,宜采用秩和检验或 CMH(Cochran-Mantel-Haenszel)检验。
二、最佳选择题¶
-
四格表通常在什么情况下使用 Fisher 确切概率法(C)
A. \(1≤T<5, n≥40\);B. \(T<5\);C. \(T<1\) 或 \(n<40\);D. \(T≤1\) 或 \(n≤100\)。 -
下列比较不适用 χ² 检验的是(A)
A. 两样本均数比较;B. 两样本率比较;C. 多个样本构成比比较;D. 多个样本率比较。 -
四格表周边合计不变时,某格实际频数变化,其理论频数(C)
A. 增大;B. 减小;C. 不变;D. 随实际频数增减。 -
四格表中有一个实际频数为 0 时(C)
A. 不能做 χ² 检验;B. 必须用校正 χ² 检验;C. 尚不能据此决定是否可做 χ² 检验;D. 只能用确切概率法。 -
χ² 值的取值范围是(B)
A. \(-∞<χ²<∞\);B. \(0≤χ²<∞\);C. \(χ²≤1\);D. \(-∞≤χ²≤0\)。 -
A、B 两药各观察 15 人,比较疗效宜采用(B)
A. 四格表 χ² 检验;B. 四格表确切概率法;C. 四格表校正 χ² 检验;D. 配对 χ² 检验。 -
检查 673 例血清标本,比较不同血型乙肝核心抗体阳性率,宜采用(D)
A. 成组 Z 检验;B. 配对 χ² 检验;C. 四格表 χ² 检验;D. 行×列表 χ² 检验。 -
三个样本率的 χ² 检验得到 \(P < 0.05\),说明(A)
A. 三个总体率不同或不全相同;B. 三个总体率都不同;C. 三个样本率都不同;D. 三个样本率不同或不全相同。
三、计算分析题¶
1. 两种疗法治疗脑梗死的效果¶
| 疗法 | 有效 | 无效 | 合计 | 有效率 |
|---|---|---|---|---|
| 甲疗法 | 25 | 6 | 31 | 80.65% |
| 乙疗法 | 29 | 3 | 32 | 90.63% |
| 合计 | 54 | 9 | 63 | 85.63% |
- \(H0:π1 = π2\),两种疗法疗效相同。
- \(H1:π1 ≠ π2\),两种疗法疗效不同。
- \(α = 0.05\)。
- 校正 χ² 检验:\(χ² = 0.595,P = 0.44 > 0.05\)。
不拒绝 \(H0\),两种疗法的疗效差异无统计学意义。
2. 两种乳腺癌检查方法¶
已确诊乳腺癌患者 120 名:甲法检出率 60%,乙法检出率 50%,两法一致检出的比例为 35%。
| 甲法 乙法 | 阳性 | 阴性 | 合计 |
|---|---|---|---|
| 阳性 | 42 | 30 | 72 |
| 阴性 | 18 | 30 | 48 |
| 合计 | 60 | 60 | 120 |
(1)比较两种方法的检出率:McNemar 检验
- \(H0:b = c\),两种方法检出率相同。
- \(H1:b ≠ c\),两种方法检出率不同。
- \(α = 0.05\)。
- \(b+c = 48 > 40\),\(χ² = (b-c)²/(b+c) = 3\),\(P > 0.05\)。
不拒绝 \(H0\),两种方法的检出率差异无统计学意义。
(2)判断两种方法的检出结果是否有关联:四格表 χ² 检验
- \(H0\):两种方法的检出结果无关联。
- \(H1\):两种方法的检出结果有关联。
- \(α = 0.05\)。
- \(χ² = (ad-bc)²n / [(a+b)(a+c)(b+d)(c+d)] = 5.0\),\(P < 0.05\)。
拒绝 \(H0\),认为两种方法的检出结果有关联。
公式校对
原 PDF 将四格表关联性检验公式的分子排成了 \((ab-bc)²n\),应为常用公式 \((ad-bc)²n\)。本文按标准公式校正,原资料给出的统计量和结论不变。
3. 1∶1 配对病例对照研究:吸烟与肺癌¶
| 病例 对照 | 吸烟 | 不吸烟 | 合计 |
|---|---|---|---|
| 吸烟 | 120 | 25 | 145 |
| 不吸烟 | 7 | 20 | 27 |
| 合计 | 127 | 45 | 172 |
进行 McNemar 检验:
- \(H0:b = c\),吸烟与肺癌无关。
- \(H1:b ≠ c\),吸烟与肺癌有关。
- \(α = 0.05\)。
- \(b+c = 32 < 40\),采用校正公式:\(χ² = (|b-c|-1)²/(b+c) = 9.03\)。
- \(P < 0.05\),拒绝 \(H0\)。
病例组与对照组吸烟率的差异有统计学意义,认为吸烟与肺癌有关。
4. 不同就业状况慢性病患者的就诊率¶
| 就业状况 | 患病例数 | 就诊人数 | 未就诊人数 | 就诊率 |
|---|---|---|---|---|
| 在岗 | 544 | 377 | 167 | 69.3% |
| 下岗/失业 | 31 | 22 | 9 | 71.0% |
| 离退休 | 251 | 209 | 42 | 83.3% |
| 学生 | 11 | 11 | 0 | 100.0% |
| 其他 | 30 | 24 | 6 | 80.0% |
| 合计 | 867 | 643 | 224 | 74.2% |
进行 2×5 行列表 χ² 检验:
- \(H0\):不同就业状况慢性病患者的就诊率相同。
- \(H1\):不同就业状况慢性病患者的就诊率不同或不全相同。
- \(α = 0.05\)。
- \(χ² = 22.10,P < 0.05\)。
拒绝 \(H0\),认为不同就业状况慢性病患者的就诊率不同或不全相同,差异具有统计学意义。