1 定义
序列分析(sequence analysis)用于分析具有时间顺序的行为序列数据。与滞后序列分析主要关注局部转移关系不同,序列分析把每名参试者或每个试次的整条行为序列作为一个分析对象,研究完整路径的组成、复杂程度以及不同路径之间的差异。
所涉及的序列包括事件序列(event sequence)和状态序列(state sequence)。事件序列记录点击、选择等瞬时发生的行为,通常没有持续时间;状态序列记录持续一段时间的状态,因此还可以分析各状态的持续时间。
2 序列特征
对一条完整序列,至少可以从两个方面描述其整体特征:
- 状态构成和持续时间,例如序列长度、经历的状态数量、各状态所占比例和平均持续时间。
- 切换和复杂程度,可以使用序列熵(entropy)、湍动度(turbulence)等指标。序列熵反映序列中状态构成的多样性,湍动度则进一步反映状态切换和整体结构的复杂程度。
3 序列之间的比较
如果希望直接比较不同样本的完整路径,可以计算任意两条序列之间的序列距离或相似度。距离有不同的计算方法。对于长度相同且位置已经对齐的序列,可以使用Hamming距离,统计两条序列在相同位置上出现不同状态的次数。对于长度不同或行为位置不能直接对应的序列,可以使用最优匹配(optimal matching),根据把一条序列转换为另一条序列所需的插入、删除和替换操作的代价衡量两条序列之间的差异。
得到序列距离矩阵后,还可以进一步采用层次聚类等聚类方法,将相似的完整序列归为若干组,从而识别典型路径或具有相似过程特征的参试者群体。