中文

语言模型的Pareto多目标对齐

应用物理 2025-08-12 v1

摘要

大型语言模型(LLMs)正日益部署在需要仔细平衡多个相互冲突目标的实际应用场景中,例如信息性与简洁性之间的平衡,或有帮助性与创造性之间的平衡。然而,当前的对齐方法主要基于RLHF,针对单个奖励函数进行优化,导致行为僵化,无法捕捉人类偏好_preferences的复杂性和多样性。这一限制阻碍了LLMs适应实际场景的能力,使多目标对齐(MOA)成为一个关键且尚未充分探索的领域。为弥合这一差距,我们提出Pareto多目标对齐(PAMA),这是一种为LLMs专门设计的、原则性且计算效率极高的算法。与计算负担沉重的多目标优化(MOO)方法不同,PAMA将多目标RLHF转化为具有闭式解的凸优化问题,显著提升了可扩展性。传统的MOO方法受制于O(n^2*d)的复杂度,其中d代表模型参数数量,通常为数十亿,这使得直接优化不可行。PAMA将复杂度降低到O(n),其中n为目标数量,使优化可在毫秒级完成。我们提供了理论保证,表明PAMA收敛于Pareto稳态点,在该点上,无法在不损害至少一个其他目标的情况下提高任何一个目标。广泛的实验在125M至7B参数的语言模型范围内表明,PAMA展现出稳健且有效的MOA能力,符合其理论优势。PAMA为解决此前被视为不可计算的MOA问题提供了高效解决方案,为将LLMs与多样化的人类价值观对齐,为灵活且可适应的实际AI部署铺平了道路。

关键词

引用

@article{arxiv.2508.07767,
  title  = {Fabry-P\'erot quasinormal modes for topological edge states},
  author = {Marc Martí-Sabaté and Benjamin Vial and Richard Wiltshaw and Sébastien Guenneau and Richard V. Craster},
  journal= {arXiv preprint arXiv:2508.07767},
  year   = {2025}
}

备注

6 pages, 4 figures