中文

面向 3D 世界的视觉查询局化

计算机视觉与模式识别 2026-05-05 v1

摘要

视觉查询局化(VQL)旨在给定查询序列中最新一次出现的预测其时空响应。目前,大多数研究聚焦于 2D 视频中的视觉查询局化,而其在 3D 空间的对应工作关注不足。本文首次尝试解决 3D 世界中的视觉查询局化问题,提出一种新型基准数据集,命名为 3DVQL。具体而言,3DVQL 包含 2002 个序列,约 17 万帧和 6400 条响应轨迹段落,涵盖 38 类目标。每个序列均提供多种模态,包括点云、RGB 图像和深度图像,以支持灵活的研究。为确保标注质量,每个序列均经过多轮人工标注的验证与细化。迄今为止,3DVQL 是首个用于 3D 多模态视觉查询局化的基准数据集。为便于后续研究的比较,我们实现了一系列以点云和 RGB 图像为代表的 3D 多模态 VQL 基线模型。实验结果显示,现有方法在不同融合模块上的性能存在显著差异。为鼓励后续研究,我们提出了一种名为 LaF 的提升-注意力融合算法,显著优于现有基线模型。我们的基准数据集和模型将在 https://github.com/wuhengliangliang/3DVQL 上公开。

关键词

引用

@article{arxiv.2605.01498,
  title  = {Towards Visual Query Localization in the 3D World},
  author = {Liang Peng and Bohan Tan and Zhipeng Zhang and Haobo Li and Yifan Jiao and Xingping Dong and Libo Zhang},
  journal= {arXiv preprint arXiv:2605.01498},
  year   = {2026}
}

备注

Accepted to CVPR 2026. 8 pages