为何是仇恨言论?用于可解释仇恨言论检测的掩码依据预测
计算与语言
2022-11-02 v1 人工智能
社会与信息网络
摘要
在仇恨言论检测模型中,除检测性能外我们还应考虑两个关键方面——偏差与可解释性。仇恨言论不能仅基于特定词的出现来识别:模型应能像人类一样推理并具有可解释性。为提升这两方面的性能,我们提出掩码依据预测(Masked Rationale Prediction,MRP)作为中间任务。MRP 是一项通过参考周围词元及其未掩码依据来预测被掩码的人类依据(作为人类判断基础的句子片段)的任务。由于模型通过 MRP 基于依据学习推理能力,其在偏差与可解释性方面鲁棒地执行仇恨言论检测。所提方法在各种指标上普遍达到最先进性能,证明了其在仇恨言论检测中的有效性。
引用
@article{arxiv.2211.00243,
title = {Why Is It Hate Speech? Masked Rationale Prediction for Explainable Hate Speech Detection},
author = {Jiyun Kim and Byounghan Lee and Kyung-Ah Sohn},
journal= {arXiv preprint arXiv:2211.00243},
year = {2022}
}
备注
10 pages, 4 figures, 3 tables. Accepted at COLING 2022