中文

Team Xiaomi EV-AD VLA:面向跨模态无人机导航的标题引导检索系统 -- IROS 2025 RoboSense 挑战赛第 4 轨道技术报告

机器人学 2025-11-07 v2

摘要

跨模态无人机导航在机器人领域仍是一个具有挑战性的任务, 需要基于自然语言描述从大规模数据库中高效检索相关图像。RoboSense 2025 第 4 轨道挑战聚焦于在多平台 (无人机、卫星和地面摄像机) 之间进行基于自然语言的跨视图图像检索。当前基线方法虽然有效于初始检索, 但常在复杂航空场景下难以实现文本查询与视觉内容之间的细粒度语义匹配。为此, 我们提出了两种检索细化方法: 标题引导检索系统 (CGRS), 通过智能重排序来增强基线粗排。我们的 method 首先利用基线模型获取每个查询最相关的 20 张图像的初始粗排, 然后使用视觉语言模型 (VLM) 为这些候选图像生成详细标题,以捕获其视觉内容的丰富语义描述。这些生成的标题随后用于多模态相似性计算框架, 对原始文本查询进行细粒度重排序, 从而在视觉内容与自然语言描述之间建立语义桥梁。我们的 approach 在所有关键指标 (Recall@1、Recall@5、Recall@10) 上均实现了持续的 5% 改进。我们的 method 在挑战赛中获得 TOP-2 排名, 表明在实际机器人导航场景中, 我们的语义细化策略具有实际价值。

关键词

引用

@article{arxiv.2510.02728,
  title  = {Team Xiaomi EV-AD VLA: Caption-Guided Retrieval System for Cross-Modal Drone Navigation -- Technical Report for IROS 2025 RoboSense Challenge Track 4},
  author = {Lingfeng Zhang and Erjia Xiao and Yuchen Zhang and Haoxiang Fu and Ruibin Hu and Yanbiao Ma and Wenbo Ding and Long Chen and Hangjun Ye and Xiaoshuai Hao},
  journal= {arXiv preprint arXiv:2510.02728},
  year   = {2025}
}