1 定义
混合效应模型(mixed-effects model)是将参试者等分组单位的系统差异纳入分析的统计模型,它可以区分固定效应和随机效应:固定效应用于估计研究者关心的自变量或控制变量的总体效应;随机效应用于表示参试者、实验材料、小组等分组单位之间的差异,以及同一单位内重复观测产生的相关性。
混合效应模型适用于重复测量、嵌套或交叉数据结构,并可在保留试次级数据的同时处理观测次数不平衡和部分缺失。
2 类型
- 因变量近似连续正态时通常使用线性混合效应模型(linear mixed-effects model,LMM)。
- 因变量为二分类、计数等非正态数据时通常使用广义线性混合效应模型(generalized linear mixed-effects model,GLMM)。
- 如果模型不能用固定效应和随机效应的线性组合来表示因变量的平均水平,则可以使用非线性混合效应模型(nonlinear mixed-effects model,NLMM),常见的NLMM例如指数增长或衰减模型、Logistic生长曲线模型等。
3 模型组成
混合效应模型主要包括固定效应、随机效应、以及单次测量的偶然误差或残差。固定效应表示总体平均效应,随机效应表示参试者等分组单位相对于该总体效应的系统偏移。
4 用于实验条件对比的分析流程
与方差分析等方法一样,用混合效应模型分析实验数据,目的也是为了验证假设、回答研究问题。因此,研究者通常不是为了得到拟合的模型,而是希望对比不同自变量水平或实验条件下的因变量是否有显著差别。具体包括三个环节:(1)检验主效应、交互效应是否显著;(2)计算各实验条件下的模型估计值;(3)比较具体条件之间的差异。整个过程类似于“ANOVA+事后比较”的流程。
4.1 主效应和交互效应检验
由于分类自变量编码的特点,模型直接输出的单个固定效应系数不一定能直接代表自变量的效应。例如,当一个分类自变量包含三个或更多水平时,它通常需要由多个虚拟变量系数共同表示,其中某一个系数的显著性不能代表该自变量的整体主效应。所以,研究者需要对构成某一主效应或交互效应的一组固定效应系数进行联合检验。
对于LMM,主效应和交互效应通常采用F检验。由于混合效应模型的分母自由度不能直接确定,常采用Satterthwaite近似或Kenward–Roger近似进行计算。Satterthwaite方法主要近似F统计量的分母自由度;Kenward–Roger方法还会调整固定效应估计的协方差矩阵和F统计量。对于GLMM,主效应和交互效应可以采用Wald卡方检验来分析,通过卡方统计量来得到固定效应的显著性。
此外,混合效应模型还可以使用似然比检验(likelihood ratio test,LRT)来检验固定效应。基本思路是分别建立两个模型:一个模型包含待检验的效应,另一个模型删除该效应,然后比较两个模型对同一批数据的拟合程度。如果删除该效应后模型的拟合显著变差,说明该效应能够提供额外的解释,应认为该效应显著。例如,检验交互效应时,可以比较“包含两个主效应和交互效应”的模型与“只包含两个主效应”的模型。软件会根据两个模型的似然值差异计算检验结果。
4.2 各实验条件的模型估计值
主效应和交互效应检验给出的是“是否存在差异”,解释差异方向和大小还需要查看各实验条件的模型估计值。在多因素实验中,研究者考察某个自变量时,通常需要将其他自变量的各个水平综合起来。这种保留当前考察的自变量、对其他自变量水平取平均后得到的均值,即边际均值(marginal mean)。
在设计平衡、各条件样本量相同、固定效应中没有额外变量时,可以直接根据原始数据计算边际均值。但当各条件样本量不相等,或模型还包含来自额外变量(例如年龄、经验等)的其他固定效应时,直接平均会把这些差异一并带入条件比较。此时通常使用估计边际均值(estimated marginal mean,EMM),即根据已经拟合的模型得到的某个自变量水平或某个条件单元的平均预测值,同时控制固定效应中的其他变量。EMM的“边际”可以理解为跨越其他被控制的变量的不同水平取平均。计算时,如果被控制的变量为分类变量,通常在其各水平上取平均;如果为连续的额外变量,则固定在均值或其他指定值。
4.3 具体条件之间的比较
完成主效应和交互效应检验,并计算各条件的估计边际均值后,研究者需要根据检验结果和研究假设,进一步比较具体条件之间的差异。这一环节也似于第9章“ANOVA+事后比较”中的事后比较环节,所采用的比较方法取决于自变量的水平数、是否存在交互效应,以及研究者是否已经预先提出了明确的比较假设。
对于只有两个水平的自变量,主效应检验本身已经是两个水平之间的比较。例如,界面复杂度只有高、低两个水平时,界面复杂度主效应显著,就表示这两个水平的总体差异显著。此时可以直接报告两个水平的EMM、置信区间和值,不需要再进行事后比较。当自变量具有三个或更多水平时,整体主效应显著还不能说明差异具体出现在哪些水平之间,需要进一步进行事后检验、两两比较,例如采用Tukey HSD检验、带有p值修正的两两t检验等。如果交互效应显著,则需要先进行简单主效应分析。
5 与重复测量ANOVA的对比
混合效应模型将参试者或分组的随机效应和残差进行了区分。这与重复测量ANOVA十分类似,重复测量ANOVA主要通过分离参试者差异来提高统计功效。对于平衡、观测完整、随机效应结构简单的数据,二者得到的结果也是相近的。混合效应模型的优势在于以下方面:
- 可以保留不同试次的数据,而不必按实验条件单元平均。
- 不仅可以处理参试者的随机效应,还能处理实验材料、分组等随机效应。
- 可以处理不平衡数据,并保留只有部分观测缺失的参试者的数据。
- 可以添加随机斜率,来表示实验条件的效应在参试者之间的变化。
- 可以扩展至二分类等非正态连续的因变量。
混合效应模型还可以直接将时间、剂量等具有连续含义的变量作为自变量纳入模型,估计因变量随其变化的趋势,而不必先将其划分为若干离散水平(虽然这种情况在人因实验中比较少见)。重复测量ANOVA通常比较预先设置的测量时点或实验条件,主要回答各离散条件之间是否存在差异;混合效应模型则既可以比较离散实验条件,也可以分析连续变量与因变量之间的关系。
不过,当实验设计规则、数据平衡且研究问题仅涉及实验条件之间的比较时,重复测量ANOVA通常更简洁。它直接按照既定实验设计分解参试者差异、主效应、交互效应和误差,不需要选择随机效应结构、额外变量的效应结构或估计方法,也较少出现模型不收敛(即软件的优化算法找不到稳定的最优模型)、随机效应奇异等问题。其分析流程、效应量和结果汇报方式高度标准化,研究者可以直接围绕各因素的主效应和交互效应解释结果。因此,研究者需要根据实际的实验设计与数据,选择合适的分析方法。