基于视觉 affordance 推理的场景无关层次化双手任务规划
机器人学
2025-12-11 v1
摘要
在开放环境中运行的具身智能体必须将高级指令转化为具体可执行的行为,往往需要协调两只手的使用。虽然最新基础模型提供了强大的语义推理能力,但现有的机器人任务规划器仍主要是单手操作,无法解决双手操作在场景无关设置下的空间、几何和协调挑战。我们提出一个统一框架,用于场景无关双手任务规划,将高级推理与3D grounding 双手执行相结合。我们的方案集成了三个关键模块。视觉点 grounding (VPG) 分析单个场景图像,检测相关对象并生成世界对齐的交互点。双手子目标规划器 (BSP) 推理空间相邻性和跨对象可达性,产生紧凑、消除运动的子目标,利用协调双手动作的机会。基于交互点的双手提示 (IPBP) 将这些子目标绑定到结构化技能库中,实例化满足手状态和affordance约束的同步单手或双手动作序列。通过这三个模块,智能体能够在以前未见的杂乱场景中规划语义上有意义、物理上可行且可并行的双手行为。实验表明,该方法能够产生连贯、可行且紧凑的双手计划,并能在无需重新训练的情况下推广到杂乱场景,展示了对双手任务的鲁健场景无关affordance推理能力。
关键词
引用
@article{arxiv.2512.09310,
title = {Scene-agnostic Hierarchical Bimanual Task Planning via Visual Affordance Reasoning},
author = {Kwang Bin Lee and Jiho Kang and Sung-Hee Lee},
journal= {arXiv preprint arXiv:2512.09310},
year = {2025}
}
备注
8 pages, 4 figures