中文

基于价值抵消的宏观动作多智能体指令遵循

人工智能 2026-05-14 v1 多智能体系统

摘要

多智能体强化学习(MARL)在实际应用场景中可能需要适应干扰 ongoing 行为的外部自然语言指令,而这些指令可能与长期目标相冲突。然而,对指令进行奖励条件化会引入根本性的失效模式,因为 Bellman 更新将指令上下文中的价值估计耦合在一起,导致指令中断宏观动作时出现不一致的价值。在本文中,我们提出了宏观动作价值校正以实现指令合规性(Macro-Action Value Correction for Instruction Compliance, MAVIC),该方法通过校正进入指令目标并恢复当前目标下的继续价值来纠正指令边界处的 Bellman 备份。不同于奖励塑形,MAVIC 修改的是自举目标本身,使在统一策略下的随机指令切换能够实现一致的价值估计。我们提供了理论分析和演员-批评家实现,表明 MAVIC 在日益复杂的合作多智能体环境中实现高指令合规性,同时保持基础任务性能。

关键词

引用

@article{arxiv.2605.12655,
  title  = {Macro-Action Based Multi-Agent Instruction Following through Value Cancellation},
  author = {Wo Wei Lin and Ethan Rathbun and Enrico Marchesini Xiang Zhi Tan},
  journal= {arXiv preprint arXiv:2605.12655},
  year   = {2026}
}