用于 LLM 微调的多奖励模型机制设计
计算机科学与博弈论
2026-02-11 v4
摘要
微调大语言模型 (LLM) 以聚合多个偏好力吸引大量研究注意。随着聚合算法的进步,潜在的经济场景出现:向偏好不同的代理人提供微调服务。在此背景下,代理人可能通过策略性误报其偏好来获益,但这可能损害聚合性能。本文通过将其建模为机制设计问题来解决此激励问题:LLM 提供者确定微调目标(训练规则)和定价方案(支付规则)供代理人使用。我们主要关注最大化社会福利且满足某些正则化条件的训练规则,称为 SW-Max 规则。首先,我们指出在大多数情况下,仅凭 SW-Max 规则,诚实报告是次优的,从而凸显了支付的必要性。其次,我们将 VCG 付款扩展以在支配策略激励兼容 (DSIC) 下实现 SW-Max 规则。我们描述了支付等价的充分条件,并推导了支付规则实现 SW-Max 规则在 DSIC 和其他原则下的必要条件。第三,我们表明我们的机制对扰动输入具有近似 DSIC,展示其对现实应用中不可避免错误的鲁棒性。实验基于真实 LLM 训练结果进一步确认了本研究结果的实际意义。
引用
@article{arxiv.2405.16276,
title = {Mechanism Design for LLM Fine-tuning with Multiple Reward Models},
author = {Haoran Sun and Yurong Chen and Siwei Wang and Xu Chu and Wei Chen and Xiaotie Deng},
journal= {arXiv preprint arXiv:2405.16276},
year = {2026}
}
备注
NeurIPS 2025