GT-Loc:通过联合嵌入空间统一图像中的时间与位置
计算机视觉与模式识别
2025-07-29 v2
摘要
时间戳预测旨在仅使用视觉信息确定图像捕获的时间,支持元数据校正、检索和数字取证等应用。在户外场景中,基于亮度、色调和阴影位置的光照线索用于估计小时时间,而季节变化和天气信息则用于估计日期。然而,这些视觉线索显著依赖于地理背景,将时间戳预测与地理定位紧密关联。为解决这种关联性,我们提出了GT-Loc,这是一种新颖的基于检索的方法,联合预测图像的捕获时间(小时和月份)和地理位置(GPS坐标)。我们的方案采用针对图像、时间和位置的独立编码器,将其嵌入共享的高维特征空间。鉴于时间的循环特性,与常规基于硬正样本和负样本的对比学习不同,我们提出了一种基于循环圆柱面上成对时间差异建模的时序度量学习目标,提供柔和目标。我们展示了新的基准测试,表明我们的联合优化方法在先前时间预测方法中取得优异成绩,即使这些方法在推理时使用真实地理位置作为输入。此外,我们的方法在标准地理定位任务上也取得竞争性成绩,并且统一的嵌入空间促进了组合式和基于文本的图像检索。
引用
@article{arxiv.2507.10473,
title = {GT-Loc: Unifying When and Where in Images Through a Joint Embedding Space},
author = {David G. Shatwell and Ishan Rajendrakumar Dave and Sirnam Swetha and Mubarak Shah},
journal= {arXiv preprint arXiv:2507.10473},
year = {2025}
}
备注
Accepted in ICCV2025