中文

AddressCLIP:赋能视觉语言模型进行城市范围图像地址定位

计算机视觉与模式识别 2024-07-12 v1

摘要

本研究提出一种新问题,称为图像地址定位(IAL),旨在预测图片拍摄的可读文本地址。现有的两种阶段方法涉及预测地理坐标并将其转换为人类可读地址,这可能导致模糊且资源密集。在 contrast learning 的基础上,我们提出了一种端到端框架,称为 AddressCLIP 来解决该问题,具有更丰富的语义,包括两个关键要素:i) 图像-文本对齐,通过对比学习将图像与地址和场景标题对齐;ii) 图像-地理匹配,通过流形学习约束图像特征与空间距离。此外,我们从匹兹堡和旧金山构建了三个规模不同的IAD数据集。实验表明,我们的方法在所提数据集上实现了卓越的性能,优于代表性的视觉语言模型迁移学习方法。进一步的大量消融和可视化实验表明,所提方法有效。数据集和源代码可在 https://github.com/xsx1001/AddressCLIP 获取。

关键词

引用

@article{arxiv.2407.08156,
  title  = {AddressCLIP: Empowering Vision-Language Models for City-wide Image Address Localization},
  author = {Shixiong Xu and Chenghao Zhang and Lubin Fan and Gaofeng Meng and Shiming Xiang and Jieping Ye},
  journal= {arXiv preprint arXiv:2407.08156},
  year   = {2024}
}

备注

Accepted at ECCV 2024