中文

精调后的安全漂移: 来自高风险领域的证据

计算机与社会 2026-04-29 v1 软件工程

摘要

基础模型在特定领域进行微调是常见做法,但安全评估通常仅在基础模型上进行,隐含假设安全特性在下游适应后得以维持.我们通过分析100个模型的安全行为来检验这一假设,包括在医疗和法律领域广泛部署的微调模型、开源基础模型的受控适应及其基座模型.在通用和领域特定安全基准测试中,我们发现良性微调会引起大规模、异构且常常相互矛盾的安全变化:模型在某些仪器上常常改善,而在其他仪器上则恶化,评估结果之间存在显著不一致.这些结果表明安全行为在正常下游适应下并非稳定,对以基础模型评估为中心的治理和部署实践提出了关键问题.若不在部署相关情境下对微调模型进行明确的重新评估,此类方法在充分管理下游风险方面不足,忽视了实践中的危害来源——这些失效在高风险情境下尤其重要,并挑战了当前的问责制范式.

关键词

引用

@article{arxiv.2604.24902,
  title  = {Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains},
  author = {Emaan Bilal Khan and Amy Winecoff and Miranda Bogen and Dylan Hadfield-Menell},
  journal= {arXiv preprint arXiv:2604.24902},
  year   = {2026}
}