大语言模型如何重新定义多智能体协调:奖励工程的终结
人工智能
2026-01-14 v1
摘要
奖励工程,即手动指定奖励函数以诱导所需的智能体行为,仍是多智能体强化学习中的根本性挑战。这一困难因信用分配模糊、环境非平稳以及交互复杂度的组合增长而被放大。我们认为,近期大语言模型(LLMs)的进展指向从手工数值奖励向基于语言的目标规范的转变。已有工作表明,LLM可以直接从自然语言描述合成奖励函数(如EUREKA),并通过最小的人工干预在线适应奖励表述(如CARD)。同时,基于可验证奖励的强化学习(Reinforcement Learning from Verifiable Rewards, RLVR)范式提供了实证数据,表明语言中介的监督可作为传统奖励工程的可行替代方案。我们沿三个维度概念化了这一转变:语义奖励规范、动态奖励适应以及与人类意图的改进对齐,同时指出与计算开销、幻觉鲁棒性以及大规模多智能体系统的可扩展性相关的开放挑战。我们指出,未来研究方向在于协调源于共享语义表示,而非显式工程化的数值信号。
引用
@article{arxiv.2601.08237,
title = {The End of Reward Engineering: How LLMs Are Redefining Multi-Agent Coordination},
author = {Haoran Su and Yandong Sun and Congjia Yu},
journal= {arXiv preprint arXiv:2601.08237},
year = {2026}
}