中文

Tox-BART:利用毒性属性生成隐式仇恨言论的解释

计算与语言 2024-06-07 v1

摘要

利用语言模型为输入的隐式仇恨帖子生成解释是一个活跃的研究领域。解释旨在明确潜在的刻板印象并辅助内容审核员。训练过程通常结合 top-k 相关的知识图谱元组,以提供世界知识并提升标准指标上的性能。有趣的是,我们的研究为知识图谱元组质量在生成隐式解释中的作用提供了相互矛盾的证据。因此,结合外部毒性信号的更简单模型优于融合知识图谱的模型。与基于知识图谱的设置相比,我们在 SBIC (LatentHatred) 数据集上观察到可比较的性能,在 BLEU、ROUGE-L 和 BERTScore 上的性能变化分别为 +0.44 (+0.49)、+1.83 (-1.56) 和 -4.59 (+0.77)。进一步的人工评估和错误分析表明,我们提出的设置比零样本 GPT-3.5 生成更精确的解释,突显了该任务的复杂性。

关键词

引用

@article{arxiv.2406.03953,
  title  = {Tox-BART: Leveraging Toxicity Attributes for Explanation Generation of Implicit Hate Speech},
  author = {Neemesh Yadav and Sarah Masud and Vikram Goyal and Vikram Goyal and Md Shad Akhtar and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2406.03953},
  year   = {2024}
}

备注

17 Pages, 5 Figures, 13 Tables, ACL Findings 2024