1 定义
朴素贝叶斯分类器(naive Bayes classifier)是一种基于概率的分类监督学习方法。与逻辑回归直接学习“给定这些特征,样本属于某个类别的概率”不同,朴素贝叶斯分类器首先考察“如果样本属于某个类别,出现当前这些特征的可能性有多大”,再结合各类别原有的比例判断样本更可能属于哪个类别。
对于候选类别,可以计算类别得分:
其中,表示训练样本中类别的比例,表示已经知道类别为时出现第项特征的可能性。模型分别计算各个类别的得分,再选择得分最高的类别作为预测结果。
2 示例
例如,假设根据“是否出现打哈欠”和“是否发生车道偏离”两个特征判断驾驶员是否疲劳。训练数据中30%的样本疲劳、70%的样本不疲劳;疲劳样本中出现这两个特征的比例分别为0.80和0.70,不疲劳样本中则分别为0.20和0.10。对于同时出现打哈欠和车道偏离的新样本:
因此,模型判断该样本更可能属于疲劳类别。
3 适用条件与注意事项
上述计算能够直接将各项特征的条件概率相乘,是因为朴素贝叶斯假定:在类别已经确定的条件下,各项特征彼此独立。“朴素”一词即来自这一简化假定。现实中的特征并不一定真正满足条件独立,但这一假定可以大幅简化模型需要估计的概率关系。
如果特征是眨眼持续时间、心率等连续数值,可以假定每项连续特征在各类别中分别服从某种概率分布,再计算当前取值在各类别下的概率密度。例如,高斯朴素贝叶斯(Gaussian naive Bayes)假定连续特征在各类别中分别服从正态分布。