1 定义

数据可视化(data visualization)是将数据转换为图形、图表等视觉形式,以呈现数据的分布、差异、变化过程或变量关系的方法。在实验数据分析中,数据可视化既用于检查异常值、偏态、天花板效应和地板效应等数据质量问题,也用于直观展示不同实验条件下的因变量差异及过程变化。常见形式包括直方图、QQ图、箱线图、小提琴图、条形图、折线图、散点图和桑基图等。数据可视化能够概括和辅助解释数据,但不能替代正式的统计检验或因果推断。

2 在描述性统计中的常见形式

2.1 检查分布与数据质量

首先可以查看因变量的分布,查看是否有极端值、或者区分度不足的情况。另外,许多统计检验方法会要求因变量(或残差)服从某种具体分布(例如正态分布)。因此,在描述性统计阶段可以进行正态性检验。具体有以下方法。

绘制直方图(histogram):直方图将某一变量的数据分成多个区间,并统计每个区间内样本的频数,来展示数据的分布形态。从直方图我们可以直观地看出,数据是否大致为正态分布,或者是偏向某一端。如下图所示,左边的直方图大体符合正态分布,而右边的数据则分布在两端,后续不适合直接采用某些参数检验方法。

绘制QQ图(Quantile-Quantile plot):QQ图将实际样本数据的分位数与理论分布(一般选择看正态分布)的分位数进行比较,从而可以直观地显示数据与目标分布的偏离程度。比如在下图中,左边数据的QQ图大致呈直线,则说明二者分位数较为一致、样本数据接近正态分布;而右边的数据则不符合正态分布。

绘制箱线图(box plot)或小提琴图(violin plot):箱线图通过中位数、四分位数、四分位距和离群点展示数据的集中趋势、离散程度与极端值(根据Q1与Q3计算得出);小提琴图则进一步展示数据在不同取值区间的密度,如下图所示。二者既可用于检查单个变量的分布,也可并列比较不同实验条件下的分布差异,并识别天花板效应、地板效应或条件间离散程度不同等问题。

2.2 展示实验条件间的因变量差异

在汇报描述性统计结果时,能够高效简洁传递信息的方法是提供描述性统计表,针对每个实验条件,列出样本量、均值、标准差等信息(根据情况还可以补充中位数、置信区间等信息)。针对不同实验条件分别计算的原因是为了与希望验证的假设以及后续假设检验保持一致。例如,如果比较两个界面的任务完成时间,就应分别列出两个界面的结果;如果验证界面复杂度与任务难度的交互效应,则需要展示每种条件组合下的描述性统计结果。此外,对于差异明显或者很重要的因变量,除了描述性统计表、以及上午所述的箱线图(box plot)与小提琴图(violin plot),还可以通过以下方式来可视化。

条形图(bar chart):条形图通常展示的是均值,可以用于对比不同组别的均值差异。还可以在均值处加上误差条(error bar),误差条可以展示置信区间,反映均值估计的不确定性。例如,下图左边是三种产品满意度的条形图,右边则进一步区分了不同性别,即能展示出产品对满意度的主效应(即产品A的满意度最高),又能展示出性别与产品的交互效应(即女生对产品A的满意度高于男生,而对产品C的满意度低于男生)。此外,许多统计工具也支持在箱线图、条形图等加上原始数据点,能够进一步展示总体趋势与数据分布。

雷达图(radar chart):有时分析者希望同时、更整体地展示多个变量的对比,例如下图从整体上对比了产品A、B、C的多个维度(可用性相关变量、绩效、环境友好程度等),可以看出产品A综合而言是最好的。不过雷达图无法清楚地展示标准差相关信息。

2.3 描述过程变化与补充关系

有些实验数据不仅有条件差异,还有过程变化。这种情况可以用折线图、哑铃图(dumbbell plot)、桑基图(sankey diagram)等方式来呈现。例如,假设研究者在探究自动驾驶接管实验中的状态转移情况, 收集了120名参试者在“接管请求出现”后,从注意分配、决策状态到最终接管结果的状态流向,可以通过桑基图来呈现,如下图所示。

如果研究问题涉及多个指标之间的关系,还可以用散点图、散点图矩阵或相关矩阵进行探索。其中,散点图(scatter plot)是一种常用的图表类型,用x轴和y轴分别代表两个变量,从而展示了两个变量之间的关系(线性、非线性或没有明显关系)。当有多个变量希望查看两两之间关系时,可以绘制散点图矩阵。需要注意的是,这类图形主要用于理解数据结构和提出解释线索,不能替代实验设计中的因果判断。