基于镜像视频的任务同时定位与可达性预测
机器人学
2025-06-13 v2 计算机视觉与模式识别
摘要
视觉语言模型(VLM)在多种领域的下游视觉和自然语言应用中表现出极大的成功。然而,这些模型仅限于对图像平面上当前可见的物体和动作进行推理。我们提出了一种对VLM的空间扩展方法,利用空间局化的镜像视频演示,以两种方式增强VLM——通过理解空间任务可达性,即智能体必须处于何处以进行物理任务,以及相对于镜像观察者的任务定位。我们展示了该方法在预测任务可能发生位置以及预测当前位置可能发生的任务方面,优于使用VLM将任务描述与带位置标签的图像集合相似性映射的基线方法。我们的方法在预测任务发生位置以及预测当前位置可能发生的任务方面的误差都更小。 resulting representation 将使机器人能够利用镜像感知导航至或绕行用于新任务的自然语言指定的物理感兴趣区域。
引用
@article{arxiv.2407.13856,
title = {Simultaneous Localization and Affordance Prediction of Tasks from Egocentric Video},
author = {Zachary Chavis and Hyun Soo Park and Stephen J. Guy},
journal= {arXiv preprint arXiv:2407.13856},
year = {2025}
}