BridgeACT:通过统一工具-目标可 affordances 连接人类演示与机器人动作
机器人学
2026-05-05 v2
摘要
从人类视频中学习机器人操作的吸引力在于人类演示的规模和多样性,但将此类演示转化为可执行的机器人行为仍具有挑战性。先前的工作要么依赖机器人数据进行下游适应,要么学习可 affordance 表示,这些表示仍停留在感知层,无法直接支持实际执行。我们提出BridgeACT,一个可 affordance 驱动的框架,直接从人类视频中学习机器人操作,而无需任何机器人演示数据。我们的关键思想是将可 affordance 建模为一种不依赖 embodiment 的中间表示,连接人类演示与机器人动作。BridgeACT 将操作分解为两个互补问题:抓取位置和运动方式。为此,BridgeACT 首先在当前场景中定位任务相关的可 affordance 区域,然后从人类演示中预测任务条件化的3D运动可 affordance。 resulting 的可 affordance 通过抓取模块和轻量级闭环运动控制器映射到机器人动作,从而实现在实际机器人上的直接部署。此外,我们将复杂操作任务表示为可 affordance 操作的组合,这允许对多样化任务和对象-对象交互进行统一处理。在实际操作任务上的实验表明,BridgeACT 优于先前基线方法,并能泛化到未见对象、场景和视角。
引用
@article{arxiv.2604.23249,
title = {BridgeACT: Bridging Human Demonstrations to Robot Actions via Unified Tool-Target Affordances},
author = {Yifan Han and Jianxiang Liu and Haoyu Zhang and Yuqi Gu and Yunhan Guo and Wenzhao Lian},
journal= {arXiv preprint arXiv:2604.23249},
year = {2026}
}