中文

探究 LLM 内容审核过度敏感中的关联偏差

计算与语言 2026-03-19 v2 人工智能

摘要

大语言模型被广泛用于内容审核,但通常表现出一定的过度敏感性,导致对良性内容的误分类并拒绝安全的用户指令。虽然先前的研究主要将此问题归因于显性冒犯性触发词的存在,但我们在统计学上揭示了一种超越词元层面的深层联系:当表现出过度敏感时,特别是在去语境化的陈述上,LLM 表现出超越显性冒犯性触发词的系统性主题-毒性关联模式。为了表征这些模式,我们提出了主题关联分析,这是一种基于行为的探针方法,它为良性输入引出简短的上下文场景,并量化场景与原始评论之间的主题放大效应。在多个 LLM 和大规模数据上,我们发现更先进的模型(例如 GPT-4 Turbo)尽管总体误报率较低,但在误报案例中表现出更强的主题关联偏斜。此外,通过受控的前缀干预,我们表明主题线索可以显著改变误报率,表明主题框架与决策相关。这些结果表明,缓解过度敏感性可能除了基于关键词的过滤外,还需要处理学习到的主题关联。

关键词

引用

@article{arxiv.2505.23914,
  title  = {Probing Association Biases in LLM Moderation Over-Sensitivity},
  author = {Yuxin Wang and Botao Yu and Ivory Yang and Saeed Hassanpour and Soroush Vosoughi},
  journal= {arXiv preprint arXiv:2505.23914},
  year   = {2026}
}

备注

Preprint