VC-Soup:基于价值一致性的多值对齐框架用于大语言模型
机器学习
2026-05-12 v2 人工智能
摘要
随着大语言模型(LLMs)在网络上日益影响内容生成、交互与决策,与人类价值观对齐已成为可信赖人工智能的核心目标。这一挑战在多值对齐时尤为突出,因为人类价值观可能存在冲突。尽管近期方法如奖励重加权、基于提示的监督微调和模型合并试图解决多值对齐问题,但仍面临两个主要局限性:(1)为每个价值组合单独训练模型的成本极高;(2)价值冲突显著降低对齐性能。这些局限性使得在多样化人类价值之间实现理想的权衡变得困难。为此,我们从数据中价值一致性的角度重新审视多值对齐,提出VC-soup——一种基于价值一致性学习的数据过滤与参数合并框架。我们首先设计了基于每组偏好对奖励间隙向量与全1向量之间余弦相似性的价值一致性度量,以量化其跨价值的一致性。随后,我们过滤掉每个价值数据集中一致性较低的偏好对,并在剩余数据上训练,以获得在保持线性模式连通性方面更佳的、价值一致的策略模型。最后,我们线性组合这些策略并在价值之间应用帕累托过滤,以获得在多价值性能之间取得平衡的解决方案。大量实验和理论分析表明,VC-soup有效缓解了冲突,并持续优于现有的多值对齐方法。
引用
@article{arxiv.2603.18113,
title = {VC-Soup: Value-Consistency Guided Multi-Value Alignment for Large Language Models},
author = {Hefei Xu and Le Wu and Yu Wang and Min Hou and Han Wu and Zhen Zhang and Meng Wang},
journal= {arXiv preprint arXiv:2603.18113},
year = {2026}
}
备注
12 pages; Accepted to WWW2026