1 定义
神经网络(neural network)是一类由相互连接的计算单元(神经元)组成的机器学习模型,其基本形式受到生物神经网络的启发。神经网络通常包括输入层、一个或多个隐藏层以及输出层。输入层接收数据,隐藏层逐层对数据进行转换,输出层给出分类结果、连续值预测或其他形式的结果。
传统机器学习方法通常需要研究者先把原始数据转换为可以用于建模的特征。例如,需要先从原始眼动轨迹中计算平均注视时长、扫视次数等指标。面对图像、视频、语音或长时间生理信号时,预先设计全部有效特征可能比较困难,此时可以使用神经网络直接从数据中学习用于预测的表示。
2 深度学习与基础模型
当神经网络包含多个隐藏层时,各层可以逐步学习不同层次的数据表示。利用多层神经网络自动学习这种层次化表示的方法称为深度学习(deep learning)。不同网络结构适合处理不同类型的数据。例如,卷积神经网络(convolutional neural network,CNN)利用卷积运算提取相邻位置的局部模式,广泛用于图像、视频和生理信号;循环神经网络(recurrent neural network,RNN)按照时间顺序处理输入,并利用内部状态保留前面时刻的信息,适合语音、生理信号和行为序列等连续数据;Transformer利用注意力机制计算序列不同位置之间的关联,目前广泛用于语言、图像、视频、语音和多模态数据。
深度神经网络通常包含大量待学习参数,并需要从数据中同时学习有效表示和预测关系,因此从头训练时往往需要大量训练数据。为了降低每个新任务都从头训练模型的成本,可以先在大规模数据上训练模型,使其学习较通用的表示,再将已经训练好的模型用于新的任务。这种方法称为预训练(pretraining)。研究者可以直接利用预训练模型提取特征,也可以使用新的数据继续训练模型,即进行微调(fine-tuning)。
基础模型(foundation model)进一步扩大了这种预训练与复用方式的规模。基础模型通常在规模较大、来源广泛的数据上进行预训练,并能够通过提示、特征提取、微调等方式适配多种下游任务。基础模型可以针对不同类型的数据训练。例如,大语言模型(large language model,LLM)主要学习语言数据,可以完成文本生成、分类、问答和信息提取等任务;视觉基础模型主要学习图像或视频表示;多模态基础模型则联合学习文本、图像、声音等不同类型的信息。在人因研究中,这类模型既可以直接承担分类和预测任务,也可以作为特征提取器,将原始图像、语音、文本或行为数据转换为新的数值表示,再用于后续统计分析或机器学习建模。