中文

用于多智能体强化学习策略对齐的视觉通用势函数

人工智能 2025-02-20 v1 机器学习

摘要

引导多智能体强化学习的策略以符合人类常识是一个难题,这主要归因于将常识建模为奖励的复杂性,尤其是在复杂且长周期的多智能体任务中。近期的工作已经展示了奖励塑造(如基于势函数的奖励)在增强策略对齐方面的有效性。然而,现有工作主要依赖专家设计基于规则的奖励,这通常费时费力,且缺乏对常识的高层语义理解。为了解决这一问题,我们提出了一种基于视觉的分层奖励塑造方法。在底层,视觉语言模型(VLM)作为通用势函数,通过其内在的语义理解引导策略与人类常识对齐。为了帮助策略适应长周期任务中的不确定性与变化,顶层采用了一个基于视觉大语言模型(vLLM)的自适应技能选择模块。该模块利用指令、视频回放和训练记录,从预先设计的池中动态选择合适的势函数。此外,我们的方法在理论上被证明能够保持最优策略。在 Google Research Football 环境中进行的大量实验表明,我们的方法不仅实现了更高的胜率,而且有效地使策略与人类常识对齐。

关键词

引用

@article{arxiv.2502.13430,
  title  = {Vision-Based Generic Potential Function for Policy Alignment in Multi-Agent Reinforcement Learning},
  author = {Hao Ma and Shijie Wang and Zhiqiang Pu and Siyao Zhao and Xiaolin Ai},
  journal= {arXiv preprint arXiv:2502.13430},
  year   = {2025}
}