大语言模型在仇恨言论去毒化中误拒行为的偏差分析
计算与语言
2026-01-14 v1
摘要
尽管大语言模型(LLM)日益被应用于仇恨言论去毒化,但提示词往往会触发安全警报,导致LLM拒绝执行任务。在本研究中,我们系统地调查了仇恨言论去毒化中的误拒行为,并分析了触发此类拒绝的上下文与语言偏差。我们在英文和多语言数据集上评估了九个LLM,结果表明,LLM对具有较高语义毒性的输入以及针对特定群体(特别是国籍、宗教和政治意识形态)的输入表现出不成比例的拒绝。尽管多语言数据集的整体误拒率低于英文数据集,但模型仍对特定目标表现出系统性的、依赖语言的偏差。基于这些发现,我们提出了一种简单的跨语言翻译策略,即将英文仇恨言论翻译为中文进行去毒化后再翻译回英文,该策略在保留原始内容的同时大幅减少了误拒,提供了一种有效且轻量级的缓解方法。
引用
@article{arxiv.2601.08668,
title = {Analyzing Bias in False Refusal Behavior of Large Language Models for Hate Speech Detoxification},
author = {Kyuri Im and Shuzhou Yuan and Michael Färber},
journal= {arXiv preprint arXiv:2601.08668},
year = {2026}
}