多元线性回归怎么做?SPSS 步骤、前提检验与结果判读
回归分析是问卷数据里用途最广的一步:它同时能回答"哪些因素有影响""影响有多大""模型整体能解释多少"。但它也是被误用最多的方法——很多人把变量丢进去、抄一遍系数就写结论,忽略了前提假设的检验。本文按"能不能用 → 怎么读 → 怎么写"的顺序讲清楚。
一、什么时候该用线性回归
| 研究问题 | 该用什么 |
|---|---|
| 几个连续变量共同预测一个连续因变量 | 多元线性回归 |
| 因变量是 0/1(是否发生) | 二元 Logistic 回归 |
| 只看两个变量之间的关联强度 | 相关分析 |
| 看 X 通过 M 影响 Y 的机制 | 中介效应 |
| 看 X 的作用在什么条件下变化 | 调节效应 |
| 比较不同组别在某个指标上的差异 | t 检验 / 方差分析 |
二、六个前提假设(做之前先检验)
| 假设 | 怎么查 | 判断标准 |
|---|---|---|
| ① 线性关系 | 散点图(X 与 Y) | 大致呈线性趋势,无明显弯曲 |
| ② 残差独立性 | Durbin-Watson 值 | 1.5 – 2.5 之间(越接近 2 越好) |
| ③ 残差正态性 | 残差直方图 / P-P 图 | 近似正态;样本大时轻微偏离可容忍 |
| ④ 方差齐性 | 残差散点图(残差 vs 预测值) | 散点随机分布、无喇叭形扩散 |
| ⑤ 无多重共线性 | VIF(方差膨胀因子) | VIF < 10,严格者要求 < 5;容差 > 0.1 |
| ⑥ 无强影响点 | 库克距离 / 标准化残差 | 库克距离 < 1;标准化残差绝对值 < 3 |
三、SPSS 操作步骤
- 菜单:分析 → 回归 → 线性。
- 把因变量放入「因变量」框,自变量放入「自变量」框。分类变量(如学历)需先转成哑变量再放入。
- 方法:先用「输入(Enter)」,即强行进入法,这是论文中最稳妥的选择。
- 点「统计量」:勾选 估计值、模型拟合度、R 方变化量、共线性诊断、Durbin-Watson。
- 点「图」:把 ZPRED 放 X 轴、ZRESID 放 Y 轴,勾选「直方图」和「正态概率图」,用于检查假设 ③④。
- 确定,读结果。
四、结果怎么读:一张表看全部
| 要看的位置 | 指标 | 含义 |
|---|---|---|
| 模型摘要 | R² | 所有自变量共同解释了因变量多少比例的变异 |
| 模型摘要 | 调整 R² | 考虑自变量个数后的修正值,报告用它 |
| 模型摘要 | Durbin-Watson | 残差独立性(1.5–2.5) |
| 方差分析表 | F 值与 p | 整个模型是否有效(p < 0.05 才算模型成立) |
| 系数表 | B(非标准化) | 自变量每变动 1 个单位,因变量变动多少(有单位) |
| 系数表 | Beta(标准化 β) | 剔除单位影响后的相对重要性,比较自变量强弱用它 |
| 系数表 | t 与 p | 该自变量是否显著 |
| 系数表 | VIF | 共线性诊断 |
五、论文里怎么写(可直接套用)
示例表述:「本研究以学业表现为因变量,以学习动机、学习投入、自我效能感为自变量进行多元线性回归分析。结果显示,回归模型整体显著(F(3, 316) = 42.87, p < 0.001),调整 R² = 0.283,说明三个自变量共同解释了学业表现 28.3% 的变异。其中学习投入(β = 0.412, p < 0.001)与学习动机(β = 0.196, p = 0.002)对学业表现具有显著正向影响,自我效能感的影响未达显著水平(β = 0.078, p = 0.126)。各变量 VIF 介于 1.24–2.06 之间,均小于 5,Durbin-Watson 值为 1.92,表明模型不存在多重共线性与残差自相关问题。」
表格建议命名为「表 N 多元线性回归结果」,列出:自变量、非标准化系数 B、标准误、标准化系数 β、t 值、p 值、VIF,最后一行附 F、调整 R²。格式见论文三线表规范。
六、样本量要多少
- 经验规则一:样本量 ≥ 50 + 8 × 自变量个数。
- 经验规则二:每个自变量至少对应 10–20 个样本。
- 更稳妥的说法:要做中介、调节、SEM 时样本量要求更高(一般 ≥ 200,复杂模型 ≥ 300)。
七、常见七个错误
- 只报 β 不报模型整体指标。 F、调整 R² 必须一起给,否则看不出模型是否成立。
- 用非标准化系数 B 比较变量重要性。 不同变量的量纲不同,比较强弱必须用标准化 β。
- 不检验前提假设就直接报结果。 至少要给 D-W 与 VIF。
- 把分类变量当连续变量。 学历、职业这类必须先做哑变量处理。
- 模型不显著还硬解释单个系数。 F 不显著时,任何单个系数的解释都不成立。
- 把 p 值当效应大小。 p < 0.001 不等于影响很大,效应强弱要看 β 与 R²。
- 用回归系数讲因果。 回归只描述"关联与预测",因果结论需要实验或纵向设计支撑。
八、常见问题
调整 R² 比 R² 小很多,正常吗?
正常。自变量越多,R² 天然越大,调整 R² 对自变量个数做了惩罚。样本量小、自变量多时两者差距会明显。挑选模型时看调整 R²。
系数方向和我预期相反怎么办?
先查共线性(VIF 是否超标)、再查是否有抑制变量或遗漏变量,最后检查数据编码(反向题、哑变量参照组)。不要为了符合预期而改模型,如实报告并讨论是学术上正确的做法。
因变量是李克特量表均分,能用线性回归吗?
可以,这是问卷研究中的通行做法(均分近似视为连续变量)。但如果因变量只有少数几个类别且分布严重偏斜,应考虑有序回归等其他方法。
用艾吖法一键生成回归分析报告
自动完成前提检验(D-W / VIF / 残差图)与回归计算,输出「模型摘要 + 方差分析表 + 回归系数表」三张标准表与解读文字。数字由统计引擎硬编码计算,与 SPSS 逐格对照一致,Word 与 Excel 双格式导出。
开始回归分析