t 检验与方差分析怎么选?差异检验选择表、前提检验与结果判读
"不同性别在学业表现上有没有差异?""三种学历水平的满意度一样吗?"——这类问题属于差异检验。它的方法家族看起来很多(单样本 t、独立样本 t、配对 t、ANOVA、非参数),但选择规则其实只有三条:比几组、样本独立不独立、数据满不满足正态。本文给出一张决策表和完整判读流程。
一、先看选择决策表
| 你的情况 | 该用什么 | 备选(前提不满足时) |
|---|---|---|
| 1 组样本 vs 一个已知标准值 | 单样本 t 检验 | Wilcoxon 符号秩检验 |
| 2 组独立样本(如男 vs 女) | 独立样本 t 检验 | Mann-Whitney U 检验 |
| 同一批人前后两次(如干预前 vs 后) | 配对样本 t 检验 | Wilcoxon 符号秩检验 |
| 3 组及以上独立样本,一个分组变量 | 单因素方差分析 | Kruskal-Wallis H 检验 |
| 3 组及以上,两个分组变量(如性别 × 学历) | 双因素 / 多因素方差分析 | —— |
| 同一批人在 3 个及以上时间点 | 重复测量方差分析 | Friedman 检验 |
二、三个前提假设
| 假设 | 怎么查 | 标准 |
|---|---|---|
| ① 独立性 | 研究设计本身决定 | 一个样本的观测不受另一个影响(独立样本)/ 成对匹配(配对样本) |
| ② 正态性 | Shapiro-Wilk 检验、偏度峰度、Q-Q 图 | 各组 p > 0.05;偏度绝对值 < 2、峰度绝对值 < 7 可视为近似正态 |
| ③ 方差齐性 | Levene 检验(SPSS 结果里叫"方差等同性检验") | p > 0.05 表示方差齐 |
三、方差不齐怎么办(关键一步)
SPSS 的 t 检验输出里有两行结果,很多人不知道该看哪一行,判断依据就是 Levene 检验:
| Levene 检验 | 该读哪一行 | 说明 |
|---|---|---|
| p > 0.05(方差齐) | 「假定方差相等」那一行 | 常规 t 检验结果 |
| p ≤ 0.05(方差不齐) | 「不假定方差相等」那一行 | Welch t 检验(校正了自由度) |
方差分析同理:方差不齐时改用 Welch ANOVA,事后比较用 Games-Howell(它不要求方差齐性),不要继续用 LSD 或 Tukey。
四、方差分析显著后做什么:事后多重比较
方差分析的 F 显著只能说明"至少有两组不同",具体是哪两组不同,要靠事后多重比较。常用方法及选择:
| 方法 | 何时用 | 特点 |
|---|---|---|
| LSD | 探索性比较、组数少 | 最宽松,不做总体控制,容易出显著结果 |
| Bonferroni | 比较次数少(< 5) | 严格,最保守;次数多时过于保守 |
| Tukey HSD | 各组样本量相等、方差齐 | 论文中最常用、认可度最高 |
| Scheffé | 组数多、比较组合复杂 | 最严格,检验力较低 |
| Games-Howell | 方差不齐 | 不要求方差齐性 |
| Dunnett | 多组 vs 一个对照组 | 只做与对照组的比较,检验力更高 |
五、效应量:比 p 值更该报告的数
| 指标 | 适用 | 小 / 中 / 大 |
|---|---|---|
| Cohen's d | t 检验 | 0.20 / 0.50 / 0.80 |
| η²(Eta 平方) | 方差分析 | 0.01 / 0.06 / 0.14 |
| 偏 η² | 多因素方差分析 | 同上(SPSS 默认输出) |
p 值只回答"差异是否可能存在",效应量回答"差异有多大"。样本量很大时,极小的差异也会显著;样本量小时,真实的大差异也可能不显著。当前期刊普遍要求在报告 p 的同时给出效应量。
六、论文里怎么写(可直接套用)
独立样本 t 检验
「独立样本 t 检验结果显示,男生与女生在学业表现上不存在显著差异(t(318) = 1.24, p = 0.216, d = 0.14)。Levene 检验表明方差齐性成立(F = 0.87, p = 0.352)。」
方差分析
「单因素方差分析结果显示,不同学历水平的研究对象在整体满意度上存在显著差异(F(3, 316) = 5.42, p = 0.001, η² = 0.049)。事后比较采用 Tukey HSD 法,结果表明本科组的满意度显著低于硕士组(均值差 = −0.32, p = 0.003),其余组间差异未达显著水平。」
表格建议命名为「表 N 不同人口学特征在主要变量上的差异检验」,列出:分组、样本量、均值 ± 标准差、t / F 值、p 值、效应量。格式见论文三线表规范。
七、非参数替代方案
遇到严重偏态、有序分类结果、样本量很小(每组 < 30)或存在极端值的情况,改用非参数检验更稳妥:
| 参数方法 | 非参数替代 | 报告统计量 |
|---|---|---|
| 独立样本 t | Mann-Whitney U | U 值、Z 值、p(可报中位数与四分位距而非均值) |
| 配对样本 t | Wilcoxon 符号秩 | Z 值、p |
| 单因素 ANOVA | Kruskal-Wallis H | H 值、p(显著后做 Dunn 事后比较) |
| 重复测量 ANOVA | Friedman 检验 | χ² 值、p |
八、常见问题
两组样本量差很多(如 40 vs 300)会有问题吗?
会有影响。样本量严重不平衡时,方差齐性检验和小样本组的结果都不稳定。建议同时报告 Welch 校正结果,并说明组间样本量差异。
用李克特量表均分做 t 检验可以吗?
可以,问卷研究中通行。但如果该变量分布严重偏斜(如 90% 的人选 5 分),建议改用非参数方法或先做数据变换。
差异不显著就没价值了吗?
不是。差异不显著本身是结论,尤其当理论预期有差异时。建议补充效应量与置信区间说明"差异小到什么程度",而不是只说一句 p > 0.05。
方差分析显著,但事后比较全都不显著,怎么回事?
可能是整体 F 的显著性来自某组与其余的对比,而事后方法过于保守;也可能是样本量不足。建议换用 LSD 或 Dunnett(如果适合你的比较结构)复核,并报告所用方法。
用艾吖法一键生成差异检验报告
自动识别分组变量类型、执行 Levene 方差齐性检验、在需要时自动切换 Welch 校正与 Games-Howell 事后比较,输出标准化表格与解读文字。数字由统计引擎硬编码计算、与 SPSS 逐格对照一致。
开始差异检验