从认知到控制——人类-人形机器人协作运输的多智能体学习
机器人学
2026-03-05 v1 人工智能
摘要
有效的人机协作(HRC)需要将高层意图转化为接触稳定的全身运动,同时持续适应人类伙伴。许多视觉-语言-动作(VLA)系统通过端到端学习从观察和指令映射到动作,但往往侧重于反应性(System 1 类)行为,亟需明确如何将持久的 System 2 式 deliberation 与可靠低延迟连续控制集成。这种差距在多智能体 HRC 中尤为突出——长期程度的协调决策与物理执行必须在接触、可行性和安全约束下共同演化。我们通过认知到控制(C2C)框架解决此问题,这是一个三层体系,将 deliberation-控制 路径明确化:(1)基于视觉语言模型的 grounding 层,维护持久的场景参照物,推断具象化感知约束;(2) deliberative 技能/协调层——System 2 核心——通过去中心化 MARL 形式化为马尔可夫潜在博弈,编码任务进度的共享潜在变量,以人类-机器人耦合优化长程技能选择与序列;(3)全身控制层,在高频下执行所选技能,确保运动学/动力学可行性和接触稳定性。deliberative 层相对于标准控制器实现为残差策略,内化伙伴动态,无需显式角色分配。实验在协作操纵任务中表明,C2C 在成功率和鲁棒性上优于单智能体和端到端基线,实现稳定协调,出现领导-跟随行为。
引用
@article{arxiv.2603.03768,
title = {Cognition to Control - Multi-Agent Learning for Human-Humanoid Collaborative Transport},
author = {Hao Zhang and Ding Zhao and H. Eric Tseng},
journal= {arXiv preprint arXiv:2603.03768},
year = {2026}
}