面向隐式有害内容的目标片段检测
计算与语言
2024-07-01 v2
摘要
识别仇恨言论的目标是理解此类言论本质的关键一步,并最终有助于改进在线论坛中攻击性帖子的检测。在线平台上的许多有害内容使用隐式语言,尤其是在针对弱势和受保护群体时,例如使用刻板印象特征而非明确的目标名称,这使得检测和缓解此类语言变得更加困难。在本研究中,我们专注于识别仇恨言论的隐含目标,这对于识别更微妙的仇恨言论和增强数字平台上对有害内容的检测至关重要。我们定义了一项新任务,旨在即使目标未被明确陈述也能将其识别出来。为了解决该任务,我们在三个著名的隐式仇恨言论数据集(SBIC、DynaHate 和 IHC)中收集并标注了目标片段。我们将由此产生的合并集合称为 Implicit-Target-Span。该集合是通过一种创新的池化方法实现的,该方法使用了基于人工标注和大语言模型(LLMs)的匹配分数。我们的实验表明,Implicit-Target-Span 为目标片段检测方法提供了一个具有挑战性的测试平台。
引用
@article{arxiv.2403.19836,
title = {Target Span Detection for Implicit Harmful Content},
author = {Nazanin Jafari and James Allan and Sheikh Muhammad Sarwar},
journal= {arXiv preprint arXiv:2403.19836},
year = {2024}
}