1 定义

信任校准(trust calibration)指用户根据系统实际表现调整自己的信任水平,使其与系统真实能力相匹配的过程。当二者相匹配时,通常称为适当信任(appropriate trust);当信任超过系统实际能力时称为过度信任(overtrust),低于系统实际能力时称为信任不足(undertrust)。信任校准包括三个评价维度 [@leeTrustAutomationDesigning2004a]:

  • 校准度(calibration):用户总体信任水平与系统实际能力的匹配程度。
  • 分辨率(resolution):用户能否根据系统能力的高低相应调整信任,即对高能力系统给予更高信任,对低能力系统给予更低信任。
  • 特异性(specificity):用户能否针对不同功能和任务形成不同程度的信任,而不是将对系统某一方面的信任泛化到所有情境。

2 测量

信任校准的测量需要同时获得主观信任和客观系统表现两个信息来源。以下为几类常见的测量方法:

  1. 信任-性能偏差:分别测量用户的主观信任水平和系统的客观表现,然后计算二者之间的偏差。例如系统实际准确率为70%,参与者报告的信任水平为80%,则二者存在10个百分点的正偏差,表明用户高估了系统能力,即出现过度信任。偏差法的优点是直观、易于计算,也是目前校准研究中最常见的方法之一。但它本质上提供的是校准状态的总体快照,而无法进一步说明偏差产生的原因。
  2. 依赖-性能偏差:对比用户的依赖行为与系统客观表现的一致性,当系统输出正确时用户是否采纳,当系统输出错误时用户是否拒绝。这种方法在自动化告警、目标检测等用户进行多个二元决策的任务中尤其常见,而且不需要插入问卷,更容易用于连续监测。这一思路还可以利用信号检测理论进行量化,将用户对系统建议的采纳与拒绝行为转化为灵敏度或决策标准等指标,从而分析用户是否根据系统真实能力合理调整决策行为。不过依赖行为不直接等同于主观信任,因此这种方法并非直接测得的信任校准。
  3. 校准曲线(calibration curve):在不同信心水平下统计系统的实际正确率,绘制主观信心与客观正确率之间的对应关系,得到校准曲线。理想的曲线应该接近y=x的直线,其他情况则对应过度信任、信任不足的情况。

3 参考文献

Lee, J. D., & See, K. A. (2004). Trust in Automation: Designing for Appropriate Reliance. Human Factors, 46(1), 50–80. https://doi.org/10.1518/hfes.46.1.50_30392