中文

为何是仇恨言论?用于可解释仇恨言论检测的掩码依据预测

计算与语言 2022-11-02 v1 人工智能 社会与信息网络

摘要

在仇恨言论检测模型中,除检测性能外我们还应考虑两个关键方面——偏差与可解释性。仇恨言论不能仅基于特定词的出现来识别:模型应能像人类一样推理并具有可解释性。为提升这两方面的性能,我们提出掩码依据预测(Masked Rationale Prediction,MRP)作为中间任务。MRP 是一项通过参考周围词元及其未掩码依据来预测被掩码的人类依据(作为人类判断基础的句子片段)的任务。由于模型通过 MRP 基于依据学习推理能力,其在偏差与可解释性方面鲁棒地执行仇恨言论检测。所提方法在各种指标上普遍达到最先进性能,证明了其在仇恨言论检测中的有效性。

关键词

引用

@article{arxiv.2211.00243,
  title  = {Why Is It Hate Speech? Masked Rationale Prediction for Explainable Hate Speech Detection},
  author = {Jiyun Kim and Byounghan Lee and Kyung-Ah Sohn},
  journal= {arXiv preprint arXiv:2211.00243},
  year   = {2022}
}

备注

10 pages, 4 figures, 3 tables. Accepted at COLING 2022