基于开放词汇方法的基于上下文的运动检索——面向自动驾驶
计算机视觉与模式识别
2025-08-13 v2 计算与语言
信息检索
机器人学
摘要
自动驾驶系统必须在涉及易瞬时用户(VRUs)等异常或复杂行为的安全关键场景中可靠运行。识别驾驶数据集中此类边缘案例对于系统的鲁棒性评估和泛化至关重要,但在大规模数据集的尾部检索稀有人类行为场景具有挑战性。为支持多样化、以人为中心的场景进行有针对性的评估,我们提出一种新型的上下文感知运动检索框架。该方法将基于 Skinned Multi-Person Linear(SMPL)的人体动作序列及其对应的视频帧编码到与自然语言对齐的共享多模态嵌入空间。我们的 approach 使通过文本查询检索人类行为及其上下文成为可扩展的。本工作还引入了WayMoCo数据集,这是Waymo开放数据集的一个扩展版本。该数据集包含从生成的伪地面实况SMPL序列及其对应图像数据中自动生成的运动和场景上下文描述。我们的方法在WayMoCo数据集上评估时,相较于基于SOTA模型实现了最高达27.5%的检索准确率提升。
引用
@article{arxiv.2508.00589,
title = {Context-based Motion Retrieval using Open Vocabulary Methods for Autonomous Driving},
author = {Stefan Englmeier and Max A. Büttner and Katharina Winter and Fabian B. Flohr},
journal= {arXiv preprint arXiv:2508.00589},
year = {2025}
}
备注
Project page: https://iv.ee.hm.edu/contextmotionclip/; This work has been submitted to the IEEE for possible publication