MotIF:运动指令微调
机器人学
2025-11-19 v1 人工智能
计算机视觉与模式识别
摘要
尽管许多机器人任务的成功与否只需观察最终状态及其与初始状态的差异即可判定——例如是否捡起了苹果——但许多任务需要观察机器人的完整运动才能正确判断是否成功。例如,梳头需要与头发的轮廓和类型相匹配的重复动作。先前的工作通常使用现成的视觉语言模型 (VLM) 作为成功检测器;然而,当成功与否取决于完整轨迹时,VLM 由于两个原因难以做出正确判断。首先,现代 VLM 仅在单帧上训练,无法捕捉完整轨迹上的变化。其次,即使我们为最先进的 VLM 提供多帧的聚合输入,由于缺乏机器人数据,它们仍然无法检测成功。我们的核心思想是使用能够捕捉轨迹级信息的抽象表示来微调 VLM,例如通过在最终图像上叠加关键点轨迹来表示机器人所走的路径。我们提出了运动指令微调 (MotIF),这是一种使用上述抽象表示来微调 VLM 的方法,以在环境中语义地锚定机器人的行为。为了对机器人运动理解进行基准测试并微调 VLM,我们引入了 MotIF-1K 数据集,其中包含跨越 13 个任务类别的 653 个人类演示和 369 个机器人演示。MotIF 在给定轨迹的图像观察、任务指令和运动描述的情况下评估机器人运动是否成功。我们的模型在精确率上比最先进的 VLM 至少高出两倍,在召回率上高出 56.1%,并且能够泛化到未见过的运动、任务和环境中。最后,我们展示了 MotIF 在优化和终止机器人规划,以及根据轨迹与任务和运动描述的匹配程度对轨迹进行排序方面的实际应用。项目页面:https://motif-1k.github.io
引用
@article{arxiv.2409.10683,
title = {MotIF: Motion Instruction Fine-tuning},
author = {Minyoung Hwang and Joey Hejna and Dorsa Sadigh and Yonatan Bisk},
journal= {arXiv preprint arXiv:2409.10683},
year = {2025}
}