中文

毒性检测应衡量情境危害而非文本固有之恶

机器学习 2026-05-13 v4 人工智能 计算与语言

摘要

毒性检测已成为在线内容审核、数据集过滤和已部署语言模型系统的核心安全基础设施。然而,大多数检测器仍将毒性视为孤立文本的固有属性。本文立场认为,毒性检测应被评估为对情境交际危害的情境化衡量,而非单标签文本分类。毒性不仅蕴含于词语之中;它产生于交际行为在规范和社会情境中被受众解读之时。我们引入了情境压力框架(CSF),将毒性定义为感知到的规范违背与引发的应激或破坏之间的关系。CSF 解释了文本固有检测器为何会过度标记方言或 reclaimed language,遗漏隐蔽或语用层面的滥用,并在保持语义不变的转换下依然脆弱。我们提出了 CSF-Eval,一个将文本风险、规范违背、破坏、不确定性与政策行动区分开来的评估议程。

关键词

引用

@article{arxiv.2503.16072,
  title  = {Toxicity Detection Should Measure Contextual Harm, Not Text-Intrinsic Badness},
  author = {Sergei Berezin and Reza Farahbakhsh and Noel Crespi},
  journal= {arXiv preprint arXiv:2503.16072},
  year   = {2026}
}