仇恨言论分类中的预测不确定性估计
计算与语言
2019-12-13 v3 机器学习
机器学习
摘要
由于社交网络的普及,近年来仇恨言论现象显著增加。因其对少数群体及大型社区的害处,迫切需要进行仇恨言论检测与过滤。然而,自动化方法不应危及言论自由,故其决策应附带解释与不确定性评估。因此,需要不仅能够检测仇恨言论、且能帮助用户理解文本何时越界并变得不可接受的预测性机器学习模型。预测的可靠性在文本分类中通常未被关注。我们通过提出适配深度神经网络的方法来填补此空白,该网络可高效估计预测不确定性。为可靠检测仇恨言论,我们使用蒙特卡洛 dropout 正则化,其在神经网络内模拟贝叶斯推断。我们使用不同文本嵌入方法评估了我们的方法。我们以一项新技术可视化结果的可靠性,该技术有助于理解分类可靠性与错误。
引用
@article{arxiv.1909.07158,
title = {Prediction Uncertainty Estimation for Hate Speech Classification},
author = {Kristian Miok and Dong Nguyen-Doan and Blaž Škrlj and Daniela Zaharie and Marko Robnik-Šikonja},
journal= {arXiv preprint arXiv:1909.07158},
year = {2019}
}
备注
The final authenticated publication is available online at https://doi.org/10.1007/978-3-030-31372-2_24