1 定义

信度(reliability)关注测量结果的一致性与稳定性。在经典测量理论中,信度可以理解为真分数方差在测量值总方差中所占的比例,反映的是测量值中有多少差异能够归因于被测对象本身的真实差异。随机误差越大,信度越低;随机误差越小,信度越高。对不同类型的因变量可以采用不同的信度证据。

2 类型

第一,对于相对稳定的心理特质(例如人格)、能力水平或长期态度,可以采用重测信度(test-retest reliability),即让同一组参试者在两个时间点完成同一测量,并计算两次得分之间的一致程度。使用重测信度时,时间间隔需要与构念性质匹配:间隔过短可能产生记忆效应,间隔过长则可能混入真实变化。

第二,对于量表,最常用的信度指标是内部一致性(internal consistency),它检查一个量表(或一个维度)中的所有条目是否共同测量同一构念。一个很直观的想法是把量表对半分成两部分(比如奇偶题号分组),两组得分的Pearson相关系数越高,就代表内部一致。这种方式叫做分半信度(split-half reliability),它会受到分组方式的影响,所以目前用得较少。研究中最常用的指标是Cronbach’s α,它会一次性地考虑所有条目之间的协方差结构。Cronbach’s α取值不超过1,越高说明条目之间的关联越强,条目之间变化一致,量表总分越稳定。一般Cronbach’s α大于0.7就代表量表的内部一致性可以接受 [@nunnallyPsychometricTheory1978];小于0.6则代表量表条目不一致,需要逐一排查。不过,Cronbach’s α有一些局限,例如它会随着条目数量增加而变大,且假定每个条目对总分的贡献是均等的。因此,在已经进行因子分析的情况下,也可以报告McDonald’s ω。ω根据条目的因子载荷和误差方差估计内部一致性,允许不同条目对总分具有不同贡献。在实际汇报时可以同时给出α和ω;如果量表包含多个维度,应分别报告各维度的内部一致性。

第三,对于行为观察、访谈分析、开放式任务评分等情况,通常需要2人或以上来编码或打分,此时信度评价重点是评分者之间是否一致,即评分者间信度(inter-rater reliability)。根据评分或编码数据的类型以及评分者人数,有以下可选指标:

  • 数据为分类变量时,例如对视频进行行为编码,可以采用:
    • Cohen’s :适用于两个评分者对分类变量的判断。,其中 是观察到两人的一致率, 是随机打分时期望的一致率。表示一致性良好。
    • Fleiss’ :适用于三个或更多评分者对分类变量的判断,判断标准与Cohen’s 类似。
  • 当数据为连续变量时,例如专家评价参试者在实验中的产出绩效得分,可以采用组内相关系数(intraclass correlation coefficient,ICC)。ICC是一个公式家族,有多种变体,需要根据情况进行选择。例如,如果需要判断不同评分者给出的具体分值是否接近,就需要选择“absolute agreement”的ICC;如果只要评分者给的相对排名一致就行,就需要选用“consistency”的ICC。ICC大于0.75通常代表一致性良好。
  • 通用指标Krippendorff’s α:可用于任意数量评分者,也能处理评分者数量不一致和部分缺失编码的情况;可以用于名义变量、顺序变量和连续变量等不同数据类型(需要选择相应的距离函数)。Krippendorff’s α大于0.8表示一致性良好,大于0.667表示可接受。不过,当绝大多数编码集中在同一个类别时,α可能会低估一致性。

第四,对于系统日志和生理数据,信度更多体现在记录过程是否稳定、数据质量是否一致。系统日志需要确认事件触发规则是否固定、时间戳是否准确、重复记录和漏记是否可追踪等技术细节。生理指标需要检查设备连接、采样率、信号噪声、伪迹处理和有效数据比例。应明确规定数据记录规则、清洗规则、剔除标准和有效数据保留标准,使得不同主试、不同参试者、不同实验条件下的数据具有可比性。总之,信度控制不能等到数据分析阶段再计算,应贯穿测量设计和实验执行过程。

3 参考文献

Nunnally, J. C. (1978). Psychometric Theory. McGraw-Hill.