中文

基于值 decorrelation 与外推的 LLM 多值对齐

机器学习 2025-11-25 v1 人工智能 计算与语言

摘要

随着大语言模型 (LLM) 的快速发展,将其与人类价值观对齐以实现安全和伦理已成为关键挑战。这一问题在需要考虑和平衡多个可能相互冲突的人类价值时尤为棘手。尽管已提出多种现有对齐方法(如基于人类反馈的强化学习 (RLHF) 和直接偏好优化 (DPO))来解决多值对齐问题,但仍存在显著局限性:1) 这些方法在多值优化中往往不稳定且效率低下;2) 它们未能有效处理价值冲突。因此,这些方法通常难以在对齐多个价值方面实现最佳权衡。为此,我们提出了一种新型框架,称为多值对齐 (MVA)。它通过最小化不同人类价值之间的相互信息来缓解由价值间参数干扰导致的对齐退化。进一步,我们提出了价值外推策略,以高效探索帕累托前沿,从而构建一组具有不同价值偏好的 LLM。广泛的实验表明,MVA 在对齐多个人类价值方面始终优于现有基线方法。

关键词

引用

@article{arxiv.2511.17577,
  title  = {Efficient Mathematical Reasoning Models via Dynamic Pruning and Knowledge Distillation},
  author = {Fengming Yu and Qingyu Meng and Haiwei Pan and Kejia Zhang},
  journal= {arXiv preprint arXiv:2511.17577},
  year   = {2025}
}

备注

12 pages, 1 figure