中文

精调降低安全性并破坏评估一致性

计算与语言 2025-06-23 v1

摘要

为特定领域或任务微调通用大型语言模型(LLM)已成为普通用户的常规做法。然而,微调已知会移除模型的安全对齐功能,即便微调数据中不包含任何有害内容。我们认为这是一种严重的失效模式,由于微调的广泛采用以及攻击的良性特性,导致大多数良意的开发者可能意识到自己正在部署降低了安全性的LLM。另一方面,这一已知漏洞可以被恶意行为者轻易利用,以规避安全警戒。要取得任何有意义的进展,首先需要可靠且可重复的安全评估。在本文中,我们调查了安全基准对实验程序中细微变动以及LLM随机性的鲁性。我们的初始实验暴露出即使在看似不重要的变动下,对安全评估结果也会出现惊人的方差。我们的观察对本领域的研究者而言,对于在未来启用有意义的比较,报告结果具有严重的含义。

关键词

引用

@article{arxiv.2506.17209,
  title  = {Fine-Tuning Lowers Safety and Disrupts Evaluation Consistency},
  author = {Kathleen C. Fraser and Hillary Dawkins and Isar Nejadgholi and Svetlana Kiritchenko},
  journal= {arXiv preprint arXiv:2506.17209},
  year   = {2025}
}

备注

to appear at LLMSEC 2025