融合人类解释以提升仇恨言论检测的鲁棒性
计算与语言
2024-11-12 v1
摘要
鉴于大转换语言模型(LM)的黑箱性质和复杂性,关于泛化性和鲁棒性的担忧对仇恨言论(HS)检测等领域具有伦理影响。利用内容丰富的社会偏见框架数据集(包含人类标注的刻板印象、意图和目标群体),我们开发了一个三阶段分析来评估LMs是否忠实地评估仇恨言论。首先,我们观察到需要建模语境相关的刻板印象意图以捕捉隐含的语义含义。接下来,我们设计了一个新任务——刻板印象意图蕴含(SIE),鼓励模型在语境中理解刻板印象的存在。最后,通过消融测试和用户研究,我们发现SIE目标改善了内容理解,但在建模隐含意图方面仍存在挑战。
引用
@article{arxiv.2411.06213,
title = {Incorporating Human Explanations for Robust Hate Speech Detection},
author = {Jennifer L. Chen and Faisal Ladhak and Daniel Li and Noémie Elhadad},
journal= {arXiv preprint arXiv:2411.06213},
year = {2024}
}
备注
2021 ACL Unimplicit Workshop