分层指令感知的具身视觉跟踪
计算机视觉与模式识别
2025-05-28 v1
摘要
以用户为中心的具身视觉跟踪(UC-EVT)对基于强化学习的模型提出了新的挑战,因为高层用户指令与低层智能体动作之间存在巨大差距。尽管语言模型(如 LLM、VLM、VLA)的最新进展提升了指令理解能力,但这些模型在 UC-EVT 任务中面临推理速度(LLM、VLM)或泛化性(VLA)方面的关键限制。为应对这些挑战,我们提出了分层指令感知的具身视觉跟踪(HIEVT)智能体,它利用空间目标作为中介,桥接指令理解与动作生成。HIEVT 首先引入基于 LLM 的语义-空间目标对齐器,将多样化的人类指令转化为直接标注期望空间位置的空间目标。然后,基于强化学习的自适应目标对齐策略,作为一种通用的离线策略,使跟踪器能够根据空间目标指定的位置定位目标。为了对 UC-EVT 任务进行基准测试,我们收集了超过一千万条轨迹用于训练,并在一个已见环境和九个未见过的挑战性环境中进行评估。大量实验和真实世界部署证明了 HIEVT 在不同环境、变化的目标动态以及复杂指令组合下的鲁棒性和泛化能力。完整项目可在 https://sites.google.com/view/hievt 获取。
引用
@article{arxiv.2505.20710,
title = {Hierarchical Instruction-aware Embodied Visual Tracking},
author = {Kui Wu and Hao Chen and Churan Wang and Fakhri Karray and Zhoujun Li and Yizhou Wang and Fangwei Zhong},
journal= {arXiv preprint arXiv:2505.20710},
year = {2025}
}