HCDIR:面向在线评论的端到端仇恨语境检测与强度降低模型
计算与语言
2023-12-21 v1 人工智能
摘要
警告:本文包含部分人可能认为具有冒犯性的语言示例。检测并减少仇恨、辱骂、冒犯性评论是社交媒体上一项关键且具挑战性的任务。此外,旨在缓解仇恨言论强度的研究寥寥无几。虽然研究表明语境层面的语义对于检测仇恨评论至关重要,但由于拥有充足的数据集,大多数此类研究集中于英语。相比之下,由于数据集有限,印地语等低资源语言仍研究不足。与仇恨言论检测不同,仇恨强度降低在高资源语言和低资源语言中均未被探索。在本文中,我们提出了一种新型端到端模型 HCDIR,用于社交媒体帖子中的仇恨语境检测与仇恨强度降低。首先,我们微调了多个预训练语言模型以检测仇恨评论,从而确定性能最佳的仇恨评论检测模型。然后,我们识别了语境中的仇恨词汇。此类仇恨词汇的识别通过最先进的可解释学习模型,即 Integrated Gradient (IG) 进行了论证。最后,采用掩码语言建模模型捕捉领域特定细微差别,以降低仇恨强度。我们掩盖了被识别为仇恨评论中 50\% 的仇恨词汇,并为这些被掩盖的词汇预测替代词以生成令人信服的句子。从可行句子中优先选择对原始仇恨评论的最佳替换。我们在多个最新数据集上使用基于自动指标的评估和详尽的人工评估进行了广泛实验。为了提高人工评估的可靠性,我们安排了一组具有不同专业背景的三名人工标注员。
引用
@article{arxiv.2312.13193,
title = {HCDIR: End-to-end Hate Context Detection, and Intensity Reduction model for online comments},
author = {Neeraj Kumar Singh and Koyel Ghosh and Joy Mahapatra and Utpal Garain and Apurbalal Senapati},
journal= {arXiv preprint arXiv:2312.13193},
year = {2023}
}