中文

H3Fusion:对齐 LLM 的有益、无害、诚实融合

计算与语言 2026-01-22 v4 人工智能 机器学习

摘要

LLM 对齐持续引起行业和学术界的广泛关注,旨在确保响应有益、无害且诚实。然而,同时满足这三种性质的表示子空间中的点仍然具有挑战性。H3Fusion 通过引入基于混合专家(MoE)的融合机制,将对齐建模为在子空间内受控漂移,由漂移正则化损失引导,以平衡竞争的对齐维度。此外,我们构建了双目标问题,即通过最大化生成嵌入与对齐嵌入之间的距离来实现对齐,并通过将激活 canalized 到贡献专家上,引入门控损失。对三个基准数据集的广泛评估显示,H3Fusion 在三个方面均表现出更有帮助、更无害、更诚实:它相较于每个 individually 对齐模型提升 11.37%,在三方面(相较于最先进的 LLM 集成方法提升 13.77%,相较于模型合并方法提升 6.18%)提供更强的鲁棒性。代码已公开于 https://github.com/git-disl/h3fusion。

关键词

引用

@article{arxiv.2411.17792,
  title  = {H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs},
  author = {Selim Furkan Tekin and Fatih Ilhan and Tiansheng Huang and Sihao Hu and Yichang Xu and Zachary Yahn and Ling Liu},
  journal= {arXiv preprint arXiv:2411.17792},
  year   = {2026}
}