1 定义

假设检验是用样本数据判断关于总体的统计假设是否得到足够证据支持的一类统计推断方法,用于验证样本结果是否足以支持总体中存在明显的差异、关系或效应。

2 过程

假设检验首先需要明确两个相互竞争的假设:零假设(null hypothesis,H0)表示没有差异、没有关系或没有效应;备择假设(alternative hypothesis,H1)表示存在差异、关系或效应。一般实验希望证明存在差异、关系或效应,例如,要比较两种界面的任务完成时间,零假设可以写成“两种界面的总体平均完成时间相同”,将备择假设写成“两种界面的总体平均完成时间不同”。

接下来,研究者根据样本数据计算检验统计量(test statistic)。如果零假设H0为真,统计量会服从某种已知的概率分布(即有特定形状的概率密度函数)。根据所选的分析方法(例如T检验、ANOVA等)不同,检验统计量所服从的分布不同,例如T检验的检验统计量服从T分布;对于ANOVA的检验统计量服从F分布。根据所收集的样本数量、变量条件等数据,还能计算出分布的重要参数,其中包括自由度(degree of freedom,df),它会决定上述分布的具体形状。

在零假设H0为真的情况下,根据检验统计量的具体数值、所服从分布的具体概率密度函数,就可以计算出采样观察到当前检验统计量(或更极端的值)的概率,也就是p值。p值越小,说明如果H0为真,当前数据越不常见,反过来便能说明备择假设H1更有可能成立。那么,多小的p值才算足够小?研究者需要预先设定一个判断阈值,称为显著性水平(significance level),通常记为。常见设定是。如果假设检验得到,研究者便可以拒绝零假设,并称结果“统计显著”;如果,则通常认为当前样本没有提供足够证据拒绝零假设。

3 注意事项

3.1 效应值与有效性

需要说明,p值主要回答“在零假设为真时,当前数据有多罕见”,但不能代表效应的大小或检验的有效性。效应的大小需要根据效应值判断。

关于假设检验的有效性,需要先说明检验决策和实际情况的可能组合。研究者通过假设检验做出了决策(支持H1或不拒绝H0),但有可能恰巧由于样本收集等原因,导致这一决策与实际情况不符。如下表所示,有两种决策与实际不符的情况,分别是一类错误和二类错误。

表1. 假设检验决策的四种结果

真实情况决策:支持H1决策:不拒绝H0
其实H0为真:总体中没有效应一类错误(Type I error):把不存在的效应判断为存在正确判断:没有发现效应
其实H1为真:总体中存在效应正确判断:检出效应二类错误(Type II error):没有发现真实效应

一类错误(Type I error)是实际上H0为真但错误地拒绝了H0,也就是把不存在的效应判断为存在。显著性水平α控制的是一类错误率。α=0.05,表示在零假设为真且模型假设成立时,把不存在的效应误判为存在的长期比例约为 5%。

二类错误(Type II error)是真实效应存在但没有拒绝H0,也就是漏掉了真实效应,通常这一错误率记为则表示在真实效应存在时,研究能够检出该效应的概率,也就是统计功效(statistical power),可以通过功效分析来计算。

3.2 多重比较

假设检验时还要注意多重比较(multiple comparisons)问题。多重比较常见于三个以上实验条件之间进行两两比较的场景、或者同时分析多个因变量、在许多协变量或分组中寻找显著结果等情况。如果研究者进行很多次统计检验,即使每次检验的一类错误率都是0.05,至少出现一次假阳性的概率也会升高。例如,若独立进行20次检验,每次,全部都不出错的概率约为,至少一次出错的概率约为0.64。在具体分析时,可以对多重比较的结果进行修正,例如采用Bonferroni校正、Holm校正、Benjamini-Hochberg方法等。

4 例子

大体包括参数检验(如t检验方差分析多元线性回归)与非参数检验(如Wilcoxon秩和检验卡方检验)等。