基于鲁棒训练与弃权的公平且校准的毒性检测
机器学习
2026-05-15 v1
摘要
毒性分类中的公平性涉及三个综合维度:排序、校准和弃权。训练时的干预措施与事后安全机制不能被独立评估,因为前者决定了后者的有效性。我们在这三个维度上比较了经验风险最小化(ERM)、实例级重加权和 Group DRO,并结合了温度缩放、基于置信度的弃权以及按身份阈值优化。评估使用了子群 AUC、BPSN/BNSP AUC、误差差距以及带有自助法置信区间()的各子群期望校准误差(ECE)。我们报告了四项发现。(1)校准差异是一种隐蔽的公平性违规。ERM 具有近乎完美的总体校准(),但在所有身份子群中均存在显著校准不良( 至 )。(2)训练干预重塑而非消除了差异。重加权 ERM 改善了排序(BPSN AUC 至 ),但使校准公平性差距恶化了高达 。Group DRO 消除了校准差异,但仅以在全球范围内变得一致校准不良为代价(ECE )。(3)事后方法继承了训练的失败模式。温度缩放失败是因为校准不良是非均匀的。基于置信度的弃权 在 ERM 下有效,但在 DRO 下失效,此时风险-覆盖曲线随延迟而上升。(4)弃权本身是不公平的。基于置信度的延迟对背景内容的帮助远大于对提及身份内容的帮助。我们认为 SRAI 公平性需要一个多维度框架:仅在总体排序上存在差异的方法,在决定现实世界危害的失败模式上可能存在巨大差异。
引用
@article{arxiv.2605.14074,
title = {Fair and Calibrated Toxicity Detection with Robust Training and Abstention},
author = {Mokshit Surana},
journal= {arXiv preprint arXiv:2605.14074},
year = {2026}
}