中文

TIGeR:面向时间、图像与地理位置检索的统一框架

计算机视觉与模式识别 2026-03-31 v2

摘要

许多现实世界应用(如数字 Forensics、城市监控和环境分析)都需要就视觉外观、位置和时间进行联合推理。除标准的地理位置定位和捕获时间预测外,这些应用日益需要更复杂的能力,例如检索在查询图像所在位置但在指定目标时间捕获的图像。我们将此问题形式化为 Geo-Time Aware Image Retrieval,并提出 TIGeR,一个面向 Time、Images 和 Geo-location 检索的统一框架。TIGeR 支持灵活的输入配置(单模态和多模态查询),使用相同表示执行 (i) 地理位置定位、(ii) 捕获时间预测、(iii) 地理-时间感知检索。通过在大幅度外观变化下保持底层位置身份,TIGeR 能够实现基于场景捕获位置和时间的检索,而非仅依据视觉相似性。为支持此任务,我们设计了多阶段数据 curated 流程,并提出了包含 450 万对 image-location-time 三元组的新型数据集用于训练,以及 86000 个高质量三元组用于评估。广泛实验表明,TIGeR 在 time-of-year 上优于强基准和最新方法提升最高可达 16%,在 time-of-day 预测上提升 8%,在地理-时间感知检索召回率上提升 14%,凸显了统一地理时序建模的优势。

关键词

引用

@article{arxiv.2603.24749,
  title  = {TIGeR: A Unified Framework for Time, Images and Geo-location Retrieval},
  author = {David G. Shatwell and Sirnam Swetha and Mubarak Shah},
  journal= {arXiv preprint arXiv:2603.24749},
  year   = {2026}
}

备注

Accepted in CVPR 2026