多目标 LLM 对齐的双向偏好-策略优化:Meta-Aligner
高能物理 - 唯象学
2026-04-28 v1 核理论
摘要
多目标对齐旨在通过同时优化多个目标来将大型语言模型(LLM)与多样且常常相互冲突的人类价值观相匹配。现有方法主要依赖静态偏好权重构建策略。然而,严格地对固定目标进行对齐会丢弃有价值的中间信息,因为训练得到的响应本身即包含有效的偏好权衡,即使偏离目标亦然。为此,我们提出了 Meal,即 MEta ALigner,一个支持偏好与策略响应之间双向优化的双层元学习框架,生成以训练为导向的动态偏好。具体而言,我们引入一个偏好权重网络作为元学习器,基于输入提示生成自适应偏好权重,并将偏好权重作为可学习参数进行更新;而 LLM 策略则作为 base-learner,基于这些偏好进行响应生成优化,并采用拒绝抽样策略。广泛的实证结果表明,我们的方法在多个多目标基准测试上实现了卓越的性能,验证了动态双向偏好-策略优化框架的有效性。
引用
@article{arxiv.2604.24177,
title = {Selected Topics in Quark-Hadron Physics: From Scalar Nonets to Topological Glueballs},
author = {Chihiro Sasaki},
journal= {arXiv preprint arXiv:2604.24177},
year = {2026}
}
备注
10 pages, 4 figures, prepared for the proceedings of the 66th Cracow School of Theoretical Physics "Physics of Strong Interactions under Extreme Conditions"