面向机器人感知与遥操作规划的开放词汇时空场景图
机器人学
2025-10-28 v2 人工智能
摘要
通过自然语言进行的遥操作可减轻操作员负担并提升高风险或远程环境中的安全性。然而,在动态远程场景中,双向通信的传输延迟会造成远程感知状态与操作员意图之间的差距,导致指令误解与错误执行。为缓解此问题,我们引入了时空开放词汇场景图(ST-OVSG),这是一种利用时间动态和轻量级延迟标注来丰富开放词汇感知的表示方法。ST-OVSG 利用大型视觉语言模型(LVLMs)构建开放词汇的 3D 对象表示,并通过匈牙利指派及我们设计的时间匹配代价将其扩展到时间域,从而生成统一的时空场景图。图中嵌入了延迟标签,使 LVLM 规划器能够回溯查询过去的场景状态,从而解决由传输延迟引起的本地-远程状态不匹配问题。为进一步减少冗余并突出任务相关线索,我们提出了一种面向任务的子图过滤策略,为规划器生成紧凑的输入。ST-OVSG 可泛化到新类别,并增强规划对传输延迟的鲁棒性,无需微调。实验表明,我们的方法在 Replica 基准上达到了 74% 的节点准确率,优于 ConceptGraph。值得注意的是,在延迟鲁棒性实验中,由 ST-OVSG 辅助的 LVLM 规划器实现了 70.5% 的规划成功率。
引用
@article{arxiv.2509.23107,
title = {Open-Vocabulary Spatio-Temporal Scene Graph for Robot Perception and Teleoperation Planning},
author = {Yi Wang and Zeyu Xue and Mujie Liu and Tongqin Zhang and Yan Hu and Zhou Zhao and Chenguang Yang and Zhenyu Lu},
journal= {arXiv preprint arXiv:2509.23107},
year = {2025}
}