DART:通过蒸馏-审计-修复训练缓解差异感知大语言模型中的危害漂移
计算与语言
2026-04-21 v1
摘要
经过安全微调的大语言模型 (LLM) 通常会避免承认人口统计学差异,即使这种承认在事实上是正确的(例如,基于祖先的疾病发病率)或在上下文中是合理的(例如,基于宗教的招聘偏好)。这种身份盲区会导致错误的回答、不必要的拒绝或泛泛的“平等对待”默认输出。我们通过差异感知分类来研究这一问题:给定一个涉及人口统计学群体的问题,任务不是直接回答,而是分类正确的答案是否需要识别群体差异(是),还是应该对群体一视同仁(否)。关键的是,为追求准确性进行微调会引发危害漂移:随着决策准确性的提高,模型生成的解释会变得越来越有害,无论是通过阐述有害内容、引入有问题的假设,还是未能标记出基线模型已识别的危害。为了缓解这一问题,我们引入了 DART(蒸馏-审计-修复训练),它从教师模型中蒸馏出基于标签的推理,审计输出中相对于基线的危害漂移案例,并通过严重性加权微调修复问题案例。在八个基准测试上,DART 将 Llama-3-8B-Instruct 的准确率从 39.0% 提升至 68.8%,在平等对待提示上提升最大(从 11.3% 到 72.6%),同时将危害漂移案例减少了 72.6%。它还能迁移到 280 个涵盖医疗、法律、政策和教育领域的开放式真实世界查询中,将差异恰当回答率从 39.8% 提升至 77.5%,同时将拒绝率从 34.3% 降低至 3.0%。我们的结果表明,当存在明确的检测和修复机制时,准确性和安全性不必相互冲突。
引用
@article{arxiv.2604.16845,
title = {DART: Mitigating Harm Drift in Difference-Aware LLMs via Distill-Audit-Repair Training},
author = {Ziwen Pan and Zihan Liang and Jad Kabbara and Ali Emami},
journal= {arXiv preprint arXiv:2604.16845},
year = {2026}
}
备注
Accepted to Findings of ACL 2026