MAVIS:基于推断时价值引导选择的多目标对齐
机器学习
2026-02-17 v3
摘要
大语言模型(LLM)正在跨越 diverse applications 的部署,这些应用需要在诸如有帮助性、无害性或幽默性等多个常常冲突的目标之间进行权衡。许多传统方法需要针对每个目标或特定偏好配置进行模型微调,这既计算昂贵又缺乏灵活性。我们引入 MAVIS —— Multi-Objective Alignment via Inference-Time Value-Guided Selection(基于推断时价值引导选择的多目标对齐)——一种轻量级推断时对齐框架,使其能够在不修改基础模型权重的情况下动态控制 LLM 行为。MAVIS 训练一组小型价值模型,每个价值模型对应于一个 distinct 目标。推断时,这些价值模型使用用户指定的权重组合,以产生一个 tilting function,用于将基础模型的输出分布引导 toward desired trade-offs。价值模型使用一种简单的迭代算法进行训练,该算法使 KL 正则化策略的单调改进成为可能。我们在实证研究中表明,MAVIS 在 Pareto 前沿方面优于采用后置组合每个目标模型或训练单个偏好条件化价值模型进行指导的基线方法。我们的代码可在 https://github.com/5-Jeremy/MAVIS/tree/main 提供。
引用
@article{arxiv.2508.13415,
title = {MAVIS: Multi-Objective Alignment via Inference-Time Value-Guided Selection},
author = {Jeremy Carleton and Debajoy Mukherjee and Srinivas Shakkottai and Dileep Kalathil},
journal= {arXiv preprint arXiv:2508.13415},
year = {2026}
}
备注
32 pages, 7 figures