混合数据还是合并模型?大型语言模型帮助、诚实与无害性的平衡优化
计算与语言
2026-02-03 v4 人工智能
机器学习
摘要
在帮助、诚实和无害性(3H优化)方面实现大型语言模型(LLM)的平衡对负责任的AI至关重要。现有方法如数据混合策略面临诸多限制,包括对专家知识的重大依赖以及优化信号的相互冲突。虽然模型合并通过整合专用模型的参数提供了参数级冲突解决策略,但其在3H优化中的潜力尚未得到充分探索。本文首次系统比较了模型合并和数据混合方法在构建3H对齐LLM方面的有效性,揭示了3H维度之间以前被忽视的协作与冲突关系,并讨论了数据混合(数据层面)和模型合并(参数层面)方法在缓解3H平衡优化中的冲突方面的优势与缺点。特别地,我们提出了一种 novel 方法——Reweighting Enhanced task Singular Merging(RESM),通过异常权重和稀疏感知秩选择策略来解决3H对齐LLM合并中存在的偏好噪声累积和图层稀疏适应性挑战。广泛的评估结果表明,RESM相对于之前的数据混合方法(提升2%-5%)和模型合并方法(提升1%-3%)在实现平衡的LLM对齐方面具有有效性和鲁棒性。我们通过https://huggingface.co/Jinluan发布了我们的模型,以便进一步调查。
引用
@article{arxiv.2502.06876,
title = {Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging},
author = {Jinluan Yang and Dingnan Jin and Anke Tang and Li Shen and Didi Zhu and Zhengyu Chen and Ziyu Zhao and Daixin Wang and Qing Cui and Zhiqiang Zhang and Jun Zhou and Fei Wu and Kun Kuang},
journal= {arXiv preprint arXiv:2502.06876},
year = {2026}
}
备注
arxiv version of NeurIPS2025