1 定义
无监督学习(unsupervised learning)是一类机器学习方法,它不预先提供需要预测的目标结果,而是根据样本自身的特征寻找数据中可能存在的结构。与监督学习不同,它没有已知的结果标签供模型学习,重点是发现样本之间的分组、相似性或更简洁的数据表示。无监督学习得到的分组或低维结构并不存在预先给定的“正确答案”,因此结果通常需要结合原始特征、研究问题和具体情境进行解释。
2 类型
常见的无监督学习任务包括聚类和降维。聚类(clustering)是根据样本特征的相似性将样本划分为若干组。例如,在没有预先定义用户类型的情况下,根据参试者的注视分布、操作频率等特征识别具有相似行为模式的用户群体。常见方法包括K-means、层次聚类、DBSCAN等。
降维(dimensionality reduction)是用较少的维度概括原有的大量特征,同时尽可能保留数据中的重要结构。例如假设研究者计算了30项彼此相关的眼动指标,逐项分析既重复、也难以观察整体结构。特别是当特征数量相对于样本数量过多时,新增特征未必提供新的信息,反而可能使模型更容易过度拟合,此时可以进行降维。以下举例一些常用的降维方法:
- 主成分分析(principal component analysis,PCA)是一种线性降维方法。PCA寻找原始特征的若干线性组合:第一主成分保留数据中尽可能多的变异,第二主成分在与第一主成分正交的条件下保留尽可能多的剩余变异,后续主成分依此类推。
- 多维尺度分析(multidimensional scaling,MDS)根据样本之间的距离或相异度安排低维坐标,重点是尽量保留样本两两之间的关系。
- Isomap先建立样本的邻近网络,再尝试保留沿该网络计算的路径距离,适合表示弯曲的低维结构。
- t-SNE主要保留局部邻近关系,使原来彼此相近的样本在二维或三维图中仍尽量靠近,因此常用于高维数据的探索性可视化。