PIGEON:图像地理定位预测
计算机视觉与模式识别
2024-05-30 v6 机器学习
摘要
行星尺度的图像地理定位仍是一项挑战性难题,其源于全球各地图像的多样性。尽管基于视觉Transformer的方法在地理定位精度上已取得显著进展,但现有文献的成功受限于地标图像的狭窄分布,且性能未能泛化至未见地点。我们提出了一种结合语义地理单元创建、多任务对比预训练及新颖损失函数的地理定位系统。此外,我们的工作首次通过对位置簇进行检索来实现猜测精化。我们训练了两个模型用于街景级数据与通用图像地理定位的评估;第一个模型PIGEON在Geoguessr游戏数据上训练,能够在全球范围内将超过40%的猜测置于目标位置25公里以内。我们还开发了一个机器人并将PIGEON部署于针对人类的盲测实验中,排名位居玩家前0.01%。我们进一步与世界顶尖职业Geoguessr玩家之一展开六场对决,吸引数百万观众,并赢得全部六局。我们的第二个模型PIGEOTTO不同之处在于其在Flickr与Wikipedia图像数据集上训练,在广泛图像地理定位基准上达到SOTA结果,在城市精度层面超越先前SOTA达7.7个百分点,在国家层面达38.8个百分点。我们的发现表明,PIGEOTTO是首个有效泛化至未见地点的图像地理定位模型,且我们的方法可为高精度的行星尺度图像地理定位系统铺平道路。我们的代码已在GitHub上公开。
引用
@article{arxiv.2307.05845,
title = {PIGEON: Predicting Image Geolocations},
author = {Lukas Haas and Michal Skreta and Silas Alberti and Chelsea Finn},
journal= {arXiv preprint arXiv:2307.05845},
year = {2024}
}
备注
Accepted at CVPR 2024