中文

通过预-后调模型合并保护微调后的大语言模型

计算与语言 2025-08-29 v3

摘要

为解决下游任务微调大型语言模型(LLM)时发生的灾难性遗忘问题,尤其是损害原始对齐模型安全性。虽然已有一些方法试图通过包含额外安全数据来恢复安全性,但此类数据质量通常远不如原始对齐过程使用的数据质量。此外,这些高质量安全数据通常难以获取,难以完全恢复模型的原始安全水平。我们思考:如何在无需额外安全数据的情况下,既能保持安全性,又能提升下游任务性能?我们表明,仅通过合并预微调模型和后微调模型的权重,即可有效缓解安全降低,同时提升性能。不同下游任务和模型的实验验证了该方法的实用性和有效性。

关键词

引用

@article{arxiv.2412.19512,
  title  = {Safeguard Fine-Tuned LLMs Through Pre- and Post-Tuning Model Merging},
  author = {Hua Farn and Hsuan Su and Shachi H Kumar and Saurav Sahay and Shang-Tse Chen and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2412.19512},
  year   = {2025}
}

备注

EMNLP 2025 Findings