PGA:通过单次人机交互实现抓取智能体的个性化
机器人学
2024-03-20 v2 计算机视觉与模式识别
机器学习
摘要
语言条件机器人抓取(LCRG)旨在开发能够基于自然语言指令理解并抓取物体的机器人。尽管理解“我的钱包”这类个人物品的能力有助于更自然的人机交互,当前的 LCRG 系统仅支持通用语言指令,例如“笔记本电脑旁黑色的钱包”。为此,我们引入了一个任务场景 GraspMine 及一个新颖的数据集,旨在通过单次人机交互学习而非大规模标注数据集,来定位并抓取给定个人指示符的个人物品。我们提出的方法——个性化抓取智能体(PGA)——通过利用用户环境中未标注的图像数据(称为 Reminiscence)来解决 GraspMine。具体而言,PGA 由用户展示一件个人物品及其关联指示符来获取个人信息,随后 PGA 通过旋转该物品对其进行检视。基于所获信息,PGA 通过我们提出的标签传播算法对 Reminiscence 中的物体进行伪标注。利用从交互中获得的信息及 Reminiscence 中伪标注的物体,PGA 调整物体定位模型以抓取个人物品。这带来了显著的效率提升,而此前的 LCRG 系统依赖资源密集型人工标注——需要数百条标注数据来学习“我的钱包”。此外,PGA 在所有指标上均优于基线方法,甚至与从 9k 标注数据样本学习的全监督方法性能相当。我们进一步通过实体机器人执行 GraspMine 验证了 PGA 的现实适用性。代码与数据公开于 https://github.com/JHKim-snu/PGA。
引用
@article{arxiv.2310.12547,
title = {PGA: Personalizing Grasping Agents with Single Human-Robot Interaction},
author = {Junghyun Kim and Gi-Cheon Kang and Jaein Kim and Seoyun Yang and Minjoon Jung and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:2310.12547},
year = {2024}
}
备注
8 pages, under review