中文

结合领域向量与对齐向量以实现大语言模型中更好的知识-安全权衡

人工智能 2025-06-02 v2

摘要

近年来,训练在特定技术领域表现优于通用指令微调模型的专业大语言模型受到越来越多的关注。然而,这些专家模型在此过程中往往会丧失其安全能力,使其能够生成有害内容。作为解决方案,我们提出了一种高效且有效的基于合并的对齐方法 MergeAlign,该方法对领域向量和对齐向量进行插值,在保留领域实用性的同时创建更安全的领域特定模型。我们在医学和金融领域的 Llama3 变体上应用 MergeAlign,在领域特定基准上实现了显著的对齐提升,且领域性能仅有极小甚至没有退化。我们通过模型相似性指标和被合并模型的贡献来研究模型合并的影响。我们希望我们的发现能开辟新的研究途径,并激励更安全专家大语言模型的高效开发。

关键词

引用

@article{arxiv.2411.06824,
  title  = {Combining Domain and Alignment Vectors to Achieve Better Knowledge-Safety Trade-offs in LLMs},
  author = {Megh Thakkar and Quentin Fournier and Matthew Riemer and Pin-Yu Chen and Amal Zouaq and Payel Das and Sarath Chandar},
  journal= {arXiv preprint arXiv:2411.06824},
  year   = {2025}
}