中文

基于鲁棒训练与弃权的公平且校准的毒性检测

机器学习 2026-05-15 v1

摘要

毒性分类中的公平性涉及三个综合维度:排序、校准和弃权。训练时的干预措施与事后安全机制不能被独立评估,因为前者决定了后者的有效性。我们在这三个维度上比较了经验风险最小化(ERM)、实例级重加权和 Group DRO,并结合了温度缩放、基于置信度的弃权以及按身份阈值优化。评估使用了子群 AUC、BPSN/BNSP AUC、误差差距以及带有自助法置信区间(n=1000n = 1000)的各子群期望校准误差(ECE)。我们报告了四项发现。(1)校准差异是一种隐蔽的公平性违规。ERM 具有近乎完美的总体校准(0.0130.013),但在所有身份子群中均存在显著校准不良(+0.029+0.029+0.134+0.134)。(2)训练干预重塑而非消除了差异。重加权 ERM 改善了排序(BPSN AUC +0.06+0.06+0.12+0.12),但使校准公平性差距恶化了高达 +0.232+0.232。Group DRO 消除了校准差异,但仅以在全球范围内变得一致校准不良为代价(ECE 0.1180.118)。(3)事后方法继承了训练的失败模式。温度缩放失败是因为校准不良是非均匀的。基于置信度的弃权 在 ERM 下有效,但在 DRO 下失效,此时风险-覆盖曲线随延迟而上升。(4)弃权本身是不公平的。基于置信度的延迟对背景内容的帮助远大于对提及身份内容的帮助。我们认为 SRAI 公平性需要一个多维度框架:仅在总体排序上存在差异的方法,在决定现实世界危害的失败模式上可能存在巨大差异。

关键词

引用

@article{arxiv.2605.14074,
  title  = {Fair and Calibrated Toxicity Detection with Robust Training and Abstention},
  author = {Mokshit Surana},
  journal= {arXiv preprint arXiv:2605.14074},
  year   = {2026}
}