中文

G$^{2}$TR: 结合大型预训练模型的机器人指令跟随广义时间推理

机器人学 2024-10-11 v1

摘要

考虑这样一个场景:人类在清理桌子,而一个观察该场景的机器人接收到指令“取下我擦桌子用的布”。带有时间推理的指令跟随要求机器人识别相关的过去物体交互,在当前场景中定位感兴趣的物体,并根据人类的指令执行任务。由于对过去交互的引用具有多跳性质,且机器人工作空间视频流中的物体定位空间巨大,因此直接将引用过去交互的话语与定位物体关联起来具有挑战性。我们的关键见解是将时间推理任务分解为:(i) 估计与事件引用相关的视频区间,(ii) 对交互帧进行空间推理以推断目标物体,(iii) 在语义上追踪物体位置直至当前场景,以实现未来的机器人交互。我们的方法利用现有的大型预训练模型(这些模型具有固有的泛化能力),并适当地将它们组合起来用于时间定位任务。在一个由机器人操作器获取的视频-语言语料库上的评估显示,该语料库在空间复杂的场景中展示了丰富的时间交互,平均准确率达到70.10%。数据集、代码和视频可在 https://reail-iitdelhi.github.io/temporalreasoning.github.io/ 获取。

关键词

引用

@article{arxiv.2410.07494,
  title  = {G$^{2}$TR: Generalized Grounded Temporal Reasoning for Robot Instruction Following by Combining Large Pre-trained Models},
  author = {Riya Arora and Niveditha Narendranath and Aman Tambi and Sandeep S. Zachariah and Souvik Chakraborty and Rohan Paul},
  journal= {arXiv preprint arXiv:2410.07494},
  year   = {2024}
}