跳转至

生物统计学思考与练习:参考答案

根据《生物统计学思考与练习-参考答案-20251121.pdf》整理。内容按照章节、题型和解题步骤重新编排,便于复习与检索。

使用说明

本文尽可能保留原资料中的题目、选项、数据和参考答案,仅供复习。原资料存在少量题干、选项编号或公式笔误,本文对明显的排版错误作了校正,并在有必要处保留说明;计算结果仍建议结合教材或统计软件复核。

第一章 绪论

一、名词解释

  • 总体:根据研究目的确定的同质研究单位的全体,如某省 2000 年 14 岁男孩的身高。
  • 样本:从总体中按照随机化原则抽出的部分观察单位的某种变量集合。
  • 变异:同质研究单位中变量值间的差异,来源于各种不可控因素。
  • 概率与频率:概率是随机事件发生可能性的大小;频率是多次试验中某事件出现的比例。试验次数充分大时,频率趋近于概率。
  • 抽样误差:由于抽样造成的样本统计量与总体参数之间的差别。抽样误差不可避免,但可通过增加样本量减小。
  • 参数:由总体个体值计算得出的特征量,一般用希腊字母表示。
  • 统计量:由样本数据计算得出的特征量,一般用拉丁字母表示,用于估计总体参数。
  • 随机变量:在随机试验中取值不确定、结果由偶然因素决定的变量。

二、简答题

1. 试述医学统计学的研究步骤

  1. 设计:科学、周密的研究设计是成败的关键。
  2. 收集:准确、可靠地获取资料,如统计报表、记录、调查或实验资料。
  3. 整理:清理、录入和检查数据,进行统计描述与推断。
  4. 分析:根据资料性质和研究目的选择合适的统计方法。
  5. 解释与结论:结合研究背景合理解释结果,得出科学结论并报告。

2. A、B 两种药物治疗同一种疾病的有效率分别为 90%、70%,能否认为 A 药有效率高于 B 药

不能仅凭两个样本有效率的差异下结论。还需要明确样本量,并进行假设检验,如两独立样本率比较的 χ² 检验或 Z 检验。只有差异具有统计学意义(如 \(P < 0.05\))时,才能认为 A 药的有效率显著高于 B 药。

3. 如何理解“统计学并不能证明事物,但它可以进行推断、发现线索、提供信息,使人们据此改善事物”

统计学的根本任务是通过样本数据认识总体规律,但它所提供的是概率意义上的推断,而不是绝对的因果证明。由于研究中不可避免地存在随机误差和抽样误差,统计结论通常只能说明“差异具有统计学意义”或“存在相关性”,不能简单断言因果关系。

统计学能够量化不确定性,并通过合理的研究设计和数据分析,从复杂数据中提炼潜在规律。例如,统计学方法揭示了吸烟与肺癌之间的强相关性;这一发现本身没有直接证明因果关系,却为后续机制研究和公共卫生政策提供了重要线索。

因此,统计学可以帮助研究者建立假设、发现问题并提供决策信息,引导进一步实验和实践改进。在医学科研、临床试验和公共卫生决策中,统计学能够帮助人们在不确定条件下作出更科学的判断。

第二章 计量资料的统计描述

一、简答题

1. 统计描述主要从哪些方面发现和描述数据的基本特征

  • 集中趋势:描述数据的中心位置,常用算术均数、中位数和几何均数。
  • 离散趋势:描述数据的变异程度,常用极差、四分位数间距、方差、标准差和变异系数。
  • 分布形态:描述数据是否对称、偏态或具有不同峰态,可通过频数分布图直观观察。

2. 频数分布表的主要用途

  1. 揭示资料的分布类型。
  2. 描述分布的集中趋势和离散趋势。
  3. 便于发现某些特大或特小的可疑值。

3. 变异系数与标准差的异同

  • 相同点:二者都用于描述数据的离散趋势。
  • 不同点:标准差是绝对变异指标,单位与原数据相同;变异系数是相对变异指标,没有单位。
  • 适用场景:比较单位不同,或均数相差较大的多组数据时,宜使用变异系数。

二、最佳选择题

1. 编制频数分布表时,分组数目通常取多少为宜

答案:A

  • A. 5~15 组
  • B. 5~20 组
  • C. 10~20 组
  • D. 10~30 组
  • E. 10~15 组

2. 计算医学参考值范围的最佳方法是

答案:E

  • A. 正态分布法
  • B. 对数分布法
  • C. 百分位数法
  • D. 频数表法
  • E. 根据原始数据的分布形态选择医学参考值范围的计算方法

3. 描述一组偏态分布资料的离散趋势,下列说法正确的是

答案:D

  • A. 以极差为宜
  • B. 以标准差为宜
  • C. 以变异系数为宜
  • D. 以四分位数间距为宜
  • E. 根据资料实际特征进行选择

4. 各观察值均加或减同一个非零数后

答案:B

  • A. 均数不变,标准差改变
  • B. 均数改变,标准差不变
  • C. 两者均不变
  • D. 两者均改变
  • E. 以上都不对

5. 描述偏态分布的集中趋势,下列说法正确的是

答案:D

  • A. 以均数为宜
  • B. 以几何均数为宜
  • C. 以中位数为宜
  • D. 根据资料实际特征选择相应指标
  • E. 以上均不正确

6. 比较两地 14 岁男性少年体重观察值变异程度的大小,最佳指标是

答案:E

  • A. 标准差
  • B. 方差
  • C. 极差
  • D. 四分位数间距
  • E. 变异系数

7. 测量某地接种乙肝疫苗后的抗体滴度,反映平均滴度宜采用

答案:C

  • A. 均数
  • B. 中位数
  • C. 几何均数
  • D. 最大值
  • E. 最小值

8. 某地儿童晨尿尿胆原浓度资料宜采用什么指标描述

原题称调查 270 名儿童,数据如下:

尿胆原值(μmol/L) 0.1~ 0.4~ 0.7~ 1.0~ 1.3~ 1.6~ 1.9~ 2.2~
频数 15 37 63 56 29 20 63 46

答案:B,中位数与四分位数间距。

  • A. 均数与标准差
  • B. 中位数与四分位数间距
  • C. 几何均数与标准差
  • D. 均数与四分位数间距
  • E. 中位数与标准差

原资料数据提示

原题写“270 名儿童”,但表中频数合计为 329。本文按原表保留,使用前应核对原始题目。

9. 均数与标准差的关系是

答案:E

  • A. 均数大于标准差
  • B. 均数越大,标准差越大
  • C. 均数小于标准差
  • D. 标准差越大,均数的代表性越好
  • E. 标准差越小,均数的代表性越好

三、计算分析题

1. 100 名 7 岁男童坐高资料

原始数据(cm):

63.8 64.5 66.8 66.5 66.3 68.3 67.2 68.0 67.9 69.7 63.2 64.6 64.8
66.2 68.0 66.7 67.9 68.6 66.8 66.9 63.2 61.1 65.0 65.0 66.4 69.1
66.8 66.4 67.5 68.1 69.7 62.5 64.3 66.3 66.6 67.8 65.9 67.9 65.9
69.8 71.1 70.1 64.9 66.1 67.3 66.8 65.0 65.7 68.4 67.6 69.5 67.5
62.4 62.6 66.5 67.2 64.5 65.7 67.0 65.1 70.0 69.6 64.7 65.8 64.2
67.3 65.0 65.0 67.2 70.2 68.0 68.2 63.2 64.6 64.2 64.5 65.9 66.6
69.2 71.2 68.3 70.8 65.3 64.2 68.0 66.7 65.6 66.8 67.9 67.6 70.4
68.4 64.3 66.0 67.3 65.6 66.0 66.9 67.4 68.5

(1)频数分布

极差:

\(R = max - min = 71.2 - 61.1 = 10.1 cm\)

以 1 cm 为组距分为 11 个组段:

组段(cm) 频数
61~ 1
62~ 3
63~ 4
64~ 18
65~ 12
66~ 20
67~ 20
68~ 8
69~ 8
70~ 4
71~72 2
合计 100

分布近似正态,呈中间高、两端低的形态。坐高在 66~和 67~组的频数最高,均为 20,向两侧逐渐降低。

(2)集中趋势

  • 中位数:66.75 cm
  • 均数:66.656 cm
  • 几何均数:66.624 cm

数据分布大致对称,三个指标相近。均数利用了全部观察值,推荐用均数描述集中趋势。

(3)离散趋势

  • 极差:10.1 cm
  • 四分位数间距:\(IQR = Q3 - Q1 = 68 - 65 = 3 cm\)
  • 标准差:2.069 cm

数据分布大致对称,标准差利用了全部数据信息,推荐用标准差描述离散趋势。

2. 450 名员工左、右眼裸眼视力

眼别 ≤0.5 0.6 0.7 0.8 0.9 1.0 1.1 ≥1.2 合计
左眼 4 18 35 49 78 131 90 45 450
右眼 9 22 42 48 107 93 82 47 450

左眼

  • 原答案判断分布呈右偏态,峰值位于 1.0 视力组。
  • 集中趋势:中位数。
  • 离散趋势:四分位数间距。
  • 理由:中位数和四分位数间距受极端值影响较小,适于偏态资料。

右眼

  • 分布近似对称,峰值位于 0.9 视力组。
  • 集中趋势:均数。
  • 离散趋势:标准差。
  • 理由:均数和标准差利用全部观察值,适于近似对称资料。

3. 1982 年与 2002 年女性月经初潮年龄

年份 9 岁 10 岁 11 岁 12 岁 13 岁 14 岁 15 岁 16 岁 合计
1982 2 6 9 11 8 6 7 5 54
2002 9 11 12 8 7 3 2 2 54

指标计算

年份 中位数 均数 几何均数 极差 四分位数间距 标准差
1982 12 岁 12.6 岁 12.5 岁 7 岁 3 岁 2.0 岁
2002 11 岁 11.4 岁 11.2 岁 7 岁 2.75 岁 1.9 岁

指标选择

两组数据均呈右偏分布。推荐用中位数描述集中趋势,用四分位数间距描述离散趋势,因为二者对偏态分布和极端值不敏感。

比较

  • 2002 年中位数低于 1982 年,提示女性月经初潮年龄提前。
  • 2002 年四分位数间距较小,提示初潮年龄变异程度较小、数据更集中。
  • 两年数据均呈右偏分布;原答案认为 1982 年偏度更明显,而 2002 年分布更紧凑且整体向左移动。

第三章 计数资料的统计描述

一、名词解释

  • 结构相对数(构成比,proportion):某一组成部分观察单位数与同一事物各组成部分观察单位总数之比,用于说明各部分所占比重,通常用百分数表示。

\(构成比 = 某一组成部分观察单位数 ÷ 各组成部分观察单位总数 × 100%\)

  • 强度相对数(率,rate):说明单位时间内某现象发生的频率或强度。

\(率 = 某时期内发生某现象的观察单位数 ÷ 同期可能发生该现象的观察单位总数 × K\)

\(K\) 为比例基数,可取 100、1 000、10 000 或 100 000,使结果分别按百分数、千分数、万分数或十万分数表示。

  • 相对比(ratio):两个有关联指标 A 与 B 之比,用于说明两指标间的比例关系。A、B 可以是绝对数、相对数或平均数。

\(比 = A ÷ B\),也可表示为百分数。

  • 定基比:报告期指标与基线期指标之比,即 \(a_n / a_0\)
  • 环比:报告期指标与前一期指标之比,即 \(a_n / a_(n-1)\)
  • 平均增长速度:平均发展速度减 100%;平均发展速度是各期发展速度的几何平均数。

二、简答题

1. 结构相对数与强度相对数的区别

比较项目 结构相对数 强度相对数
定义 反映事物内部各组成部分所占比重 反映单位时间内某现象发生的频率或强度
分子与分母 分子是分母的一部分 分母是可能发生该事件的观察单位总数
特点 各部分构成比之和为 100%,各组成部分相互影响 当分母较大时,样本率近似总体率;分母不能包括不可能发生事件的对象

2. 发病率与患病率、死亡率与病死率的不同

  • 发病率的分子是一定时期、一定人群中某病新发生的病例数。
  • 患病率的分子是一定时期、一定人群中某病的新旧病例总数。
  • 死亡率的分母是同期观察人口数。
  • 病死率的分母是同期患该病的患者数。

3. 应用相对数时应注意的问题

  1. 计算相对数,特别是率时,应有足够的观察单位数。
  2. 合计率应将各组分子、分母分别合计后计算,不能直接平均各组率。
  3. 不能用结构相对数代替强度相对数。
  4. 比较资料时应注意可比性。
  5. 样本相对数的比较应进行假设检验。

4. 辛普森悖论和率的标准化

  • 辛普森悖论:在某种条件下,分组比较中都占优势的一方,在总体评价中却可能不占优势。
  • 率的标准化:先把不同组的内部结构转化为同一标准构成,再在该结构基础上计算和比较合计率,从而消除内部构成不同对合计率的影响。

三、最佳选择题

  1. 下列指标不属于相对数的是(C
    A. 率;B. 构成比;C. 百分位数;D. 相对比。

  2. 某病患者 1 000 人,其中男性 750 人、女性 250 人,分别占 75% 和 25%,正确结论是(B
    A. 男性易患该病;B. 尚不能得出有关患病情况的结论;C. 女性易患该病;D. 可计算男、女性患病率。

  3. 某地某年肝炎发病人数占同年传染病人数的 10.1%,该指标是(B
    A. 强度相对数;B. 结构相对数;C. 发病率;D. 期间患病率。

  4. 计算某地某年肺癌发病率,分母应为(C
    A. 该地体检人数;B. 该地年平均就诊人数;C. 该地年平均人口数;D. 该地平均患者人数。

  5. 实际工作中容易把构成比当作率,主要原因可能是(C
    A. 构成比比率容易计算;B. 构成比用得较多;C. 计算构成比的原始资料较率容易获得;D. 构成比与率的计算方法一样。

  6. 下列说法错误的是(B
    A. 计算率时应有足够的观察单位数或观察次数;B. 分析大样本时可以用构成比代替率;C. 应分别合计分子和分母后求合计率;D. 相对数比较应注意可比性。

  7. 某病某年发病人数为 \(a0\),以后各年为 \(a1, a2, …, an\),年平均增长速度是(D
    A. \((a_n/a_0)^(1/(n-1))\);B. \((a1+a2+…+an)/(n+1)\);C. \((a1×a2×…×an)^(1/n)\);D. \((a_n/a_0)^(1/n)-1\)

  8. 定基比和环比属于(A
    A. 相对比;B. 构成比;C. 平均数;D. 强度相对数。

  9. 比较甲、乙两厂某工种工人某种职业病患病率,对工龄进行标准化的原理是(D
    A. 假设两厂患病工人数相同;B. 假设两厂工人数相同;C. 假设两厂工人数构成相同;D. 假设两厂该工种工人的工龄构成相同。

  10. 上题标准构成应选择(D
    A. 甲厂工人的年龄构成;B. 乙厂工人的年龄构成;C. 两厂合并工人的年龄构成;D. 两厂合并工人的工龄构成。

四、计算分析题

某县 2004 年各年龄组恶性肿瘤死亡情况

年龄组(岁) 人口数 死亡数 死亡构成(%) 死亡率(1/10 万)
0~ 356 980 11 1.52 3.08
15~ 232 505 22 3.03 9.46
30~ 205 032 142 19.59 69.26
50~ 121 882 443 61.10 363.47
70~ 20 047 107 14.76 533.75
合计 936 446 725 100.00 77.42
  • \(死亡构成 = 各年龄组死亡数 ÷ 总死亡数 × 100%\)
  • \(死亡率 = 各年龄组死亡数 ÷ 各年龄组人口数 × 10⁵\)

该县 2004 年恶性肿瘤死亡率随年龄增长而上升,70 岁及以上组最高,为 533.75/10 万。

第四章 常用概率分布

一、简答题

1. 正态分布、二项分布和泊松分布的区别与联系

区别

  • 正态分布:连续型分布,呈钟形、单峰,关于 \(X = μ\) 对称。
  • 二项分布:离散型分布;在 \(n\) 重伯努利试验中,事件 A 的发生次数 \(X\) 服从二项分布。
  • 泊松分布:离散型分布;描述单位时间或单位空间内稀有事件发生次数的概率分布。

联系

  • \(nπ ≥ 5\)\(n(1-π) ≥ 5\) 时,二项分布可近似为正态分布。
  • 泊松分布是二项分布的极限:若 \(X ~ B(n, π)\),当 \(π\) 很小、\(n\) 很大时,\(X\) 近似服从均数 \(μ = nπ\) 的泊松分布。
  • \(μ ≥ 20\) 时,泊松分布可近似为正态分布。

2. 随机变量服从二项分布和泊松分布的条件

二项分布

  1. 进行相互独立的重复试验。
  2. 每次试验只有两种可能结果。
  3. 试验次数 \(n\) 固定。
  4. 每次试验中事件 A 的发生概率 \(p\) 恒定。

泊松分布

  1. 各事件的发生相互独立。
  2. 任意单位时间或空间内的平均发生率恒定。
  3. 极短时间或极小空间内发生两次及以上事件的概率可忽略不计。

3. 二项分布、泊松分布近似正态分布的条件

  • 二项分布:\(nπ ≥ 5\)\(n(1-π) ≥ 5\)
  • 泊松分布:\(μ ≥ 20\)

二、最佳选择题

  1. 正态分布 \(N(μ, σ²)\),当 μ 保持不变、σ 越小时(B
    A. 曲线越矮胖;B. 曲线越瘦高;C. 曲线沿横轴向右移动;D. 曲线沿横轴向左移动;E. 曲线不变。

  2. 某指标呈正态分布,理论上有多少观察值落在 \(X̄ ± 2.58S\) 范围内(D
    A. 68.27%;B. 90%;C. 95%;D. 99%;E. 45%。

  3. 标准正态分布曲线下,从 0 到 1.96 的面积是(D
    A. 45%;B. 90%;C. 95%;D. 47.5%;E. 99%。

  4. 正常人的尿铅含量 X 呈右偏态分布,制定双侧 95% 医学参考值范围宜采用(B
    A. \(X̄ ± 1.96S\);B. \(P2.5~P97.5\);C. \(lg⁻¹(Ȳ+1.64S_Y)\);D. \(lg⁻¹(Ȳ+1.96S_Y)\);E. \(P5~P95\)

  5. 样本例数不变时,二项分布越接近对称分布的条件是(D
    A. 总体率 π 越大;B. 样本率 p 越大;C. 总体率 π 越小;D. 总体率 π 越接近 0.5;E. 总体率 π 接近 0.1 或 0.5。

  6. 铅作业工人血片上点彩红细胞的出现数近似服从(D
    A. 二项分布;B. 正态分布;C. 偏峰分布;D. 泊松分布;E. 对称分布。

  7. 若随机变量 X 服从泊松分布,其均数 μ 与标准差 σ 的关系是(E
    A. \(μ = σ\);B. \(μ < σ\);C. \(μ > σ\);D. \(μ = σ\);E. \(μ = σ²\)

三、计算分析题

1. 某市 110 名 1 周岁男童身长资料

原始数据(cm):

70.9 65.0 76.3 74.2 79.8 74.5 80.5 71.5 78.9 71.5 76.3
66.7 70.8 68.8 77.5 74.5 83.5 82.0 70.9 73.5 77.5 77.5
81.2 77.1 72.3 76.5 74.0 74.3 74.6 72.6 71.3 73.1 78.3
75.4 69.2 70.0 71.9 76.6 78.8 77.2 73.4 68.5 77.6 76.5
75.8 64.8 75.6 80.0 76.6 76.5 77.7 74.1 80.8 70.6 79.2
76.9 70.5 74.2 77.5 76.6 82.3 72.1 69.9 79.5 75.8 76.0
78.6 80.6 75.6 73.3 68.7 74.5 78.5 71.3 72.0 73.2 74.8
68.8 76.0 82.6 69.5 77.5 80.6 81.5 75.1 65.2 68.0 80.8
73.1 66.8 72.9 75.9 72.8 70.5 74.1 74.2 75.7 73.5 73.8
68.2 73.7 84.4 74.8 72.5 74.9 74.9 74.2 73.8 76.2 80.7

(1)身长在 75.0~78.0 cm 内的比例

\(29 / 110 = 26.36%\)

(2)95% 和 99% 医学参考值范围

  • 均数:74.77 cm
  • 标准差:4.15 cm
  • 95% 范围:\(74.77 ± 1.96 × 4.15 = (66.63, 82.90) cm\)
  • 99% 范围:\(74.77 ± 2.58 × 4.15 = (64.06, 85.48) cm\)

(3)随机抽查 1 名男童,身长超过 80 cm 的概率

\(Z = (80 - 74.77) / 4.15 = 1.26\)

查标准正态分布表,概率约为 10.37%。

2. 5 名患者服药,至多 2 人发生不良反应

已知单人发生肠道不良反应的概率为 10%,令 \(X ~ B(5, 0.1)\)

\(P(X ≤ 2) = P(X=0) + P(X=1) + P(X=2) ≈ 0.99144\)

3. 调查 10 万人,其中恰有 9 人患流行性腮腺炎

患病率为 \(10 × 10⁻⁵\),调查人数为 10 万,因此泊松分布参数 \(λ = 10\)

\(P(X=9) = λ⁹e⁻λ / 9! ≈ 0.1251\)

第五章 统计表与统计图

一、简答题

1. 统计表的基本结构与制表注意事项

基本结构:标题、标目、线条、数字和备注等。

注意事项

  1. 标题应概括表的主要内容,通常在标题前编号;若数值单位相同,可在标题后统一注明。
  2. 标目应文字简明、层次清楚。
  3. 线条不宜过多,尤其不能使用竖线和斜线。
  4. 表中不宜留空格。
  5. 备注不是统计表的必备内容。

2. 统计图的基本结构与绘图注意事项

基本结构:标题、标目、图域和图例。

注意事项

  1. 根据资料性质和研究目的选择合适的统计图。
  2. 比较不同事物时,用不同线条、图案或颜色表示,并配图例。
  3. 同一统计图中的线条和图案不宜过多。
  4. 条图、直方图的纵轴坐标应从 0 开始。
  5. 绘制直方图时组距应相等。

二、最佳选择题

  1. 关于统计表制作,错误的是(B
    A. 标题放在表上方;B. 包含的内容越多越好;C. 不用竖线和斜线分隔;D. 表中不应有空格。

  2. 关于统计图绘制,错误的是(B
    A. 标题放在图下方;B. 线图中的线条越多越好;C. 直条图纵轴必须从零开始;D. 直方图组距必须相等。

  3. 比较两地 20 年来冠心病和糖尿病发病率的上升速度,宜用(D
    A. 直条图;B. 百分比条图;C. 普通线图;D. 半对数线图。

  4. 比较某地某病不同证型在不同性别间的构成,宜用(C
    A. 普通线图;B. 直方图;C. 圆图;D. 直条图。

  5. 描述某年某地非典型性肺炎的年龄分布,宜用(D
    A. 普通线图;B. 圆图;C. 直条图;D. 直方图。

三、计算分析题

1. 某地 2009 年前六位死因的死亡率

死因 死亡率(1/10 万)
循环系统疾病 266.59
肿瘤 236.67
呼吸系统疾病 75.34
损伤、中毒 40.51
内分泌营养代谢性疾病 31.10
消化系统疾病 20.39

不同死因是彼此独立的分类,适合绘制直条图

2. 某地 2001—2006 年孕产妇死亡率

年份 2001 2002 2003 2004 2005 2006
死亡率(1/10 万) 8.95 9.99 11.99 10.79 1.40 8.31

资料反映死亡率随时间的变化趋势,适合绘制普通线图。原 PDF 第 17 页给出的折线图以年份为横轴、死亡率为纵轴,变化趋势为先升高、2005 年明显降低、2006 年回升。

第六章 参数估计

一、名词解释

  • 抽样误差:由个体差异产生,并由随机抽样造成的样本统计量与总体参数之间的差异。
  • 均数标准误:样本均数的标准差,反映样本均数的抽样误差大小。
  • 率的标准误:反映样本率之间的差异,也反映样本率与相应总体率之间的差异。
  • 参数估计:利用样本统计量估计总体参数。
  • 置信区间:从总体中反复随机抽取相同样本量的样本并计算置信区间,平均有 \(1-α\)(如 95%)的区间包含总体参数。置信区间通常由两个置信限构成。

二、最佳选择题

  1. 减小抽样误差通常可采用(D
    A. 减小样本标准差;B. 增大样本标准差;C. 减小样本含量;D. 增大样本含量。

  2. 均数标准误反映(D
    A. 个体变异程度;B. 个体集中趋势;C. 样本均数的集中趋势;D. 样本均数与总体均数的差异。

  3. 关于 t 分布,说法错误的是(C
    A. t 分布图是一簇曲线;B. t 分布是单峰分布;C. 自由度相同时,\(|t|\) 越大,P 越大;D. 自由度趋于无穷时,t 分布趋于标准正态分布。

  4. 区间 \(p ± 1.96S_p\) 的含义是(B
    A. 95% 的总体率在此范围;B. 总体率的 95% 置信区间;C. 95% 的样本率在此范围;D. 样本率的 95% 置信区间。

  5. 随机抽取 100 名健康女性,血清总蛋白均数为 74 g/L、标准差为 4 g/L,总体均数的 95% 置信区间计算式为(D
    A. \(74 ± 1.96×4\);B. \(74 ± 2.58×4\);C. \(74 ± 2.58×4÷10\);D. \(74 ± 1.96×4÷10\)

三、简答题

1. 样本均数标准误与样本标准差的区别和联系

项目 样本均数标准误 样本标准差
意义 反映样本均数的变异程度和抽样误差大小 反映样本中个体值的变异程度
符号 \(σ_X̄\)\(S_X̄\) \(σ\)\(S\)
计算 \(σ_X̄ = σ/√n\)\(S_X̄ = S/√n\) \(σ = √[Σ(X-μ)²/N]\)\(S = √[Σ(X-X̄)²/(n-1)]\)
控制 增大样本量可减小标准误 由个体差异或自然变异造成,通常无法通过增大样本量消除

联系:\(σ_X̄ = σ/√n\),实际工作中用 \(S_X̄ = S/√n\) 估计。

2. t 分布的特点

  1. t 分布是一簇曲线。
  2. 单峰,以 \(t=0\) 为中心,左右对称。
  3. 自由度越小,分布越分散、曲线越平坦、尾部越高;自由度越大,分布越集中、曲线越陡峭、尾部越低。
  4. 自由度趋于无穷时,t 分布趋近标准正态分布。

3. 总体均数置信区间与医学参考值范围的区别

  • 置信区间:按一定置信度估计总体参数可能所在的范围。
  • 医学参考值范围:描述绝大多数正常个体某项指标所在的范围。

四、计算分析题

1. 正常人与病毒性肝炎患者血清转铁蛋白

组别 观测值(g/L)
正常人 2.65,2.72,2.85,2.91,2.55,2.76,2.82,2.69,2.64,2.73
患者 2.36,2.15,2.52,2.25,2.28,2.31,2.53,2.19,2.34,2.31

(1)两组总体均数的 95% 置信区间

正常人:

  • 样本均数:2.732 g/L
  • 标准差:0.108 g/L
  • 标准误:0.034 g/L
  • 95% 置信区间:\(X̄ ± t0.975 × S_X̄ = (2.655, 2.809) g/L\)

患者:

  • 样本均数:2.324 g/L
  • 标准差:0.124 g/L
  • 标准误:0.039 g/L
  • 95% 置信区间:\(X̄ ± t0.975 × S_X̄ = (2.235, 2.413) g/L\)

(2)两总体均数之差的 95% 置信区间

  • 均数差:\(2.732 - 2.324 = 0.408 g/L\)
  • 合并方差:\(S_p² = [(n1-1)S1² + (n2-1)S2²] / (n1+n2-2) = 0.0134889\)
  • 合并标准差:\(S_p = 0.11614 g/L\)
  • 均数差标准误:\(SE_diff = S_p√(1/n1 + 1/n2) ≈ 0.05194\)
  • 自由度:\(df = n1 + n2 - 2 = 18\)
  • 95% 置信区间:\(0.408 ± t0.975 × 0.05194 = (0.299, 0.517) g/L\)

2. 肾移植患者巨细胞病毒感染率

43 例患者中检出 19 例感染:

  • 样本感染率:\(p = 19/43 = 0.4419\)
  • 率的标准误:\(S_p = √[p(1-p)/n] = 0.0757\)
  • 95% 置信区间:\(p ± Z0.025S_p = (29.34%, 59.03%)\)

3. 阴道分娩与剖宫产产后出血率之差

生产方式 总例数 出血例数 出血率
阴道分娩 318 68 21.38%
剖宫产 169 24 14.20%
  • 两样本合计率:\(P_c = (x1+x2)/(n1+n2) = 0.1889\)
  • 两样本率差标准误:\(S_(p1-p2) = √[P_c(1-P_c)(1/n1+1/n2)] = 0.03726\)
  • 率差的 95% 置信区间:\((p1-p2) ± u_(α/2)S_(p1-p2) = (-0.12%, 14.48%)\)

第七章 计量资料两组均数的比较——t 检验

一、名词解释

  • P 值:在 \(H0\) 成立时,双侧检验中通过抽样获得 \(|t| ≥ t_(α/2,ν)\) 这类结果的概率。P 值不是无效假设成立的概率。
  • Ⅰ型错误\(H0\) 事实上成立,却被错误拒绝;发生概率为 α。
  • Ⅱ型错误\(H0\) 事实上不成立,却未被拒绝;发生概率为 β。
  • 检验水准:α,即 \(H0\) 为真时错误拒绝 \(H0\) 的最大允许概率。
  • 检验效能\(1-β\),又称把握度。当总体参数确有差别时,按 α 水准通过假设检验发现差别的概率。

二、简答题

1. 假设检验的基本思想与步骤

假设检验基于小概率事件和反证法思想,判断样本差异是否具有统计学意义,进而推断样本所来自的总体是否不同。

步骤:

  1. 建立检验假设,确定检验水准。
  2. 计算检验统计量。
  3. 确定 P 值,作出统计推断。

2. 假设检验与置信区间的关系

置信区间可以用于回答相应的假设检验问题;假设检验则可给出 P 值等置信区间没有直接提供的信息。二者从不同角度进行统计推断。

三、最佳选择题

  1. 关于假设检验结论,正确的是(C
    A. \(P>α\),拒绝 \(H0\),可能犯Ⅱ型错误;B. \(P<α\),不拒绝 \(H0\),可能犯Ⅱ型错误;C. \(P<α\),拒绝 \(H0\),可能犯Ⅰ型错误;D. \(P>α\),不拒绝 \(H0\),可能犯Ⅰ型错误。

  2. 两样本均数比较的 t 检验中,\(|t|\) 越大(A
    A. 越有理由拒绝 \(H0\);B. 越有理由不拒绝 \(H0\);C. 两均数差异越大;D. 两均数差异越小。

  3. 关于单侧检验与双侧检验,下列说法中有几种正确(B,2 种
    ①单侧检验比双侧检验更容易得到差异有统计学意义的结论;②想得到有统计学意义的结果就应首选单侧检验;③可在得到 P 值后根据需要选择单侧或双侧检验;④应根据专业知识在研究设计阶段确定单侧或双侧检验。选项:A. 1 种;B. 2 种;C. 3 种;D. 4 种。

  4. 两类错误的关系是(D
    A. 样本含量确定时,α 增大、β 减小;B. 增大样本含量可同时降低两类错误;C. 欲减小Ⅱ型错误概率,可取较大的 α;D. 上述说法均正确。

  5. 单样本均数 t 检验的应用前提是(A
    A. 样本来自正态总体;B. 方差齐性;C. 同时满足正态性和方差齐性;D. 任何资料均可。

四、计算分析题

1. 新减肥药与常规药对 BMI 的影响

试验组(20 人):

疗前:27.1 32.0 30.0 25.6 26.0 28.0 29.0 30.0 32.0 32.0
      26.0 27.0 28.0 29.0 30.0 25.0 26.0 29.0 32.0 34.0
疗后:21.0 26.0 26.0 22.0 22.0 24.0 26.0 28.0 28.0 29.0
      21.0 23.0 22.0 25.0 27.0 21.0 23.0 25.0 28.0 30.0

对照组(20 人):

疗前:27.5 32.0 30.0 25.5 26.0 28.0 29.0 30.0 31.6 32.0
      26.0 27.0 28.0 29.0 30.0 25.0 26.0 29.0 32.0 34.0
疗后:22.0 27.0 27.0 23.0 21.0 25.0 27.0 29.0 27.0 29.0
      22.0 25.0 23.0 24.0 29.0 22.0 23.0 23.0 27.0 29.0

(1)两种药物能否改变 BMI:分别进行配对样本 t 检验

试验组:

  • \(H0:μd = 0\),服药前后 BMI 相同。
  • \(H1:μd ≠ 0\),服药前后 BMI 不同。
  • \(α = 0.05,t = 16.946,P < 0.05\)
  • 拒绝 \(H0\),认为减肥新药可以改变 BMI。

对照组:

  • \(H0:μd = 0\),服药前后 BMI 相同。
  • \(H1:μd ≠ 0\),服药前后 BMI 不同。
  • \(α = 0.05,t = 10.838,P < 0.05\)
  • 拒绝 \(H0\),认为常规药物可以改变 BMI。

(2)新药效果是否优于常规药:比较两组 BMI 减少量

  • \(H0\):两组 BMI 减少量的总体均数相同。
  • \(H1\):两组 BMI 减少量的总体均数不同。
  • \(α = 0.05,t = 0.856,P > 0.05\)
  • 不拒绝 \(H0\),两组 BMI 减少量的差异无统计学意义,尚不能认为新药优于常规药。

原答案表述提示

原资料把这一问写为“单侧检验”,但同时把备择假设写成“不等于”,属于双侧形式。本文保留原资料给出的统计量和结论,正式分析时应在研究设计阶段明确检验方向。

2. 高原地区新生儿红细胞含量

样本数据(10¹²/L):7.0,6.9,6.8,6.5,6.8,6.1,6.0,7.3,7.2,6.0。一般地区总体均数为 \(6.5×10¹²/L\)

进行单样本 t 检验:

  • \(H0:μ = 6.5\)
  • \(H1:μ ≠ 6.5\)
  • \(α = 0.05,t = 1.042,P > 0.05\)

不拒绝 \(H0\),高原地区与一般地区新生儿红细胞含量的差异无统计学意义。

第九章 χ² 检验思考与练习

原 PDF 没有收录第八章,章节编号直接从第七章跳至第九章。

一、简答题

1. χ² 检验的基本原理

比较实际观察频数与理论频数的差异,据此判断检验假设是否成立。

2. 四格表资料如何选择检验方法

  • \(n ≥ 40\) 且所有理论频数 \(T ≥ 5\):普通 χ² 检验。
  • \(n ≥ 40\),但存在 \(1 ≤ T < 5\):连续性校正 χ² 检验。
  • \(n < 40\) 或存在 \(T < 1\):Fisher 确切概率法。

3. 行×列表 χ² 检验的注意事项

  1. 若 1/5 以上格子的理论频数 \(T < 5\),或存在一个格子 \(T < 1\),应改用 Fisher 确切概率法。
  2. 多个样本率比较若 \(P < 0.05\),应进一步进行两两比较。
  3. 单向有序的两组或多组构成比比较,宜采用秩和检验或 CMH(Cochran-Mantel-Haenszel)检验。

二、最佳选择题

  1. 四格表通常在什么情况下使用 Fisher 确切概率法(C
    A. \(1≤T<5, n≥40\);B. \(T<5\);C. \(T<1\)\(n<40\);D. \(T≤1\)\(n≤100\)

  2. 下列比较不适用 χ² 检验的是(A
    A. 两样本均数比较;B. 两样本率比较;C. 多个样本构成比比较;D. 多个样本率比较。

  3. 四格表周边合计不变时,某格实际频数变化,其理论频数(C
    A. 增大;B. 减小;C. 不变;D. 随实际频数增减。

  4. 四格表中有一个实际频数为 0 时(C
    A. 不能做 χ² 检验;B. 必须用校正 χ² 检验;C. 尚不能据此决定是否可做 χ² 检验;D. 只能用确切概率法。

  5. χ² 值的取值范围是(B
    A. \(-∞<χ²<∞\);B. \(0≤χ²<∞\);C. \(χ²≤1\);D. \(-∞≤χ²≤0\)

  6. A、B 两药各观察 15 人,比较疗效宜采用(B
    A. 四格表 χ² 检验;B. 四格表确切概率法;C. 四格表校正 χ² 检验;D. 配对 χ² 检验。

  7. 检查 673 例血清标本,比较不同血型乙肝核心抗体阳性率,宜采用(D
    A. 成组 Z 检验;B. 配对 χ² 检验;C. 四格表 χ² 检验;D. 行×列表 χ² 检验。

  8. 三个样本率的 χ² 检验得到 \(P < 0.05\),说明(A
    A. 三个总体率不同或不全相同;B. 三个总体率都不同;C. 三个样本率都不同;D. 三个样本率不同或不全相同。

三、计算分析题

1. 两种疗法治疗脑梗死的效果

疗法 有效 无效 合计 有效率
甲疗法 25 6 31 80.65%
乙疗法 29 3 32 90.63%
合计 54 9 63 85.63%
  • \(H0:π1 = π2\),两种疗法疗效相同。
  • \(H1:π1 ≠ π2\),两种疗法疗效不同。
  • \(α = 0.05\)
  • 校正 χ² 检验:\(χ² = 0.595,P = 0.44 > 0.05\)

不拒绝 \(H0\),两种疗法的疗效差异无统计学意义。

2. 两种乳腺癌检查方法

已确诊乳腺癌患者 120 名:甲法检出率 60%,乙法检出率 50%,两法一致检出的比例为 35%。

甲法 乙法 阳性 阴性 合计
阳性 42 30 72
阴性 18 30 48
合计 60 60 120

(1)比较两种方法的检出率:McNemar 检验

  • \(H0:b = c\),两种方法检出率相同。
  • \(H1:b ≠ c\),两种方法检出率不同。
  • \(α = 0.05\)
  • \(b+c = 48 > 40\)\(χ² = (b-c)²/(b+c) = 3\)\(P > 0.05\)

不拒绝 \(H0\),两种方法的检出率差异无统计学意义。

(2)判断两种方法的检出结果是否有关联:四格表 χ² 检验

  • \(H0\):两种方法的检出结果无关联。
  • \(H1\):两种方法的检出结果有关联。
  • \(α = 0.05\)
  • \(χ² = (ad-bc)²n / [(a+b)(a+c)(b+d)(c+d)] = 5.0\)\(P < 0.05\)

拒绝 \(H0\),认为两种方法的检出结果有关联。

公式校对

原 PDF 将四格表关联性检验公式的分子排成了 \((ab-bc)²n\),应为常用公式 \((ad-bc)²n\)。本文按标准公式校正,原资料给出的统计量和结论不变。

3. 1∶1 配对病例对照研究:吸烟与肺癌

病例 对照 吸烟 不吸烟 合计
吸烟 120 25 145
不吸烟 7 20 27
合计 127 45 172

进行 McNemar 检验:

  • \(H0:b = c\),吸烟与肺癌无关。
  • \(H1:b ≠ c\),吸烟与肺癌有关。
  • \(α = 0.05\)
  • \(b+c = 32 < 40\),采用校正公式:\(χ² = (|b-c|-1)²/(b+c) = 9.03\)
  • \(P < 0.05\),拒绝 \(H0\)

病例组与对照组吸烟率的差异有统计学意义,认为吸烟与肺癌有关。

4. 不同就业状况慢性病患者的就诊率

就业状况 患病例数 就诊人数 未就诊人数 就诊率
在岗 544 377 167 69.3%
下岗/失业 31 22 9 71.0%
离退休 251 209 42 83.3%
学生 11 11 0 100.0%
其他 30 24 6 80.0%
合计 867 643 224 74.2%

进行 2×5 行列表 χ² 检验:

  • \(H0\):不同就业状况慢性病患者的就诊率相同。
  • \(H1\):不同就业状况慢性病患者的就诊率不同或不全相同。
  • \(α = 0.05\)
  • \(χ² = 22.10,P < 0.05\)

拒绝 \(H0\),认为不同就业状况慢性病患者的就诊率不同或不全相同,差异具有统计学意义。