1 定义

描述性统计是对样本数据的基本特征进行概括的方法,主要用于说明数据的集中趋势、离散程度和分布形态。它回答的是“当前样本的数据长什么样”,例如观测值主要集中在哪里、差异有多大、是否存在偏态或异常值等;它本身不直接判断总体中是否存在显著差异、关系或效应。

在实验数据分析中,描述性统计通常先于假设检验进行。研究者需要先通过描述性统计与相应的数据可视化来了解样本数据的基本状态,再决定是否适合进行后续统计检验,以及如何解释检验结果。

2 类型

对于连续变量(或可以近似当做连续的变量),研究者可以先查看这一样本频率分布(frequency distribution)或直方图,了解观测值主要落在哪些区间、分布是否偏态、是否有多个峰,以及是否存在明显异常值。

随后可以用分位数(quantile)进一步概括分布位置,即把样本从小到大排序。四分位数Q1、Q2、Q3分别对应25%、50%和75%位置,50%分位数的Q2也叫中位数,表示有一半观测值不超过它。频率分布可用于观察数据的中间范围和偏态程度,以及变量所服从的分布。

对于一个变量,最精炼的描述性统计量是均值和标准差。它们也能够反映分布情况,均值反映这组数据的典型水平在哪里,标准差反映观测值围绕这个典型水平分散到什么程度。研究者可以用样本均值和样本标准差来概括当前样本,并作为总体参数的估计。均值(mean,M)是最常见的集中趋势指标。对于一组数据,均值为:

方差(variance)和标准差(standard deviation,SD)描述数据的离散程度。标准差是方差的平方根: