中文

MAESTRO:基于元学习的奖励优化标量化权衡自适应估计

机器学习 2026-04-14 v2 计算与语言

摘要

群相对策略优化 (GRPO) 已成为对齐大型语言模型 (LLM) 的高效范式,但其有效性主要局限于具有可验证真实答案的领域。将 GRPO 扩展到开放域设置仍是一个关键挑战,因为无约束的生成涉及多方面且常常相互冲突的目标——例如创造力与事实性——其中刚性、静态的奖励标量化方法本质上都次优的。为此,我们提出了 MAESTRO (Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization),它引入了一个元认知编排层,将奖励标量化视为动态潜在策略,利用模型的终端隐藏状态作为语义瓶颈来感知任务特定的优先事项。我们将其形式化为双层优化框架中的情境臂虫问题,其中一个轻量级的 Conductor 网络利用群相对优势作为元奖励信号与策略共生。跨七个基准测试,MAESTRO 在单奖励和静态多目标基线中始终表现优于,并保留了 GRPO 的效率优势,在某些情况下甚至减少了冗余生成。

关键词

引用

@article{arxiv.2601.07208,
  title  = {MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization},
  author = {Yang Zhao and Hepeng Wang and Xiao Ding and Yangou Ouyang and Bibo Cai and Kai Xiong and Jinglong Gao and Zhouhao Sun and Li Du and Bing Qin and Ting Liu},
  journal= {arXiv preprint arXiv:2601.07208},
  year   = {2026}
}

备注

ACL 2026 Main Conference