AddressVLM:基于大型视觉语言模型用于图像地址定位的跨视图对齐微调
计算机视觉与模式识别
2025-08-15 v1 人工智能
摘要
大型视觉语言模型(LVLMs)在国家或城市层面的粗略地理定位方面表现出色,但在城市区域内的街道级精细定位方面仍面临挑战。本文探索将城市级地址定位能力集成到LVLMs中,以利用街景图像实现灵活的地址相关问答功能。关键挑战在于,街景视觉问答(VQA)数据仅提供微观视觉线索,导致精调后模型性能不佳。为此,我们引入透视不变的卫星图像作为宏观线索,提出跨视图对齐微调,包括卫星视图和街景视图图像嵌入机制,以及自动标签生成机制。通过跨视图匹配增强LVLMs对街道分布的全局理解。我们提出的模型称为AddressVLM,包括两个阶段的训练协议:跨视图对齐微调和地址定位微调。此外,我们基于匹切弗森和旧金山的图像地址定位数据集构建了两个街景VQA数据集。定性和定量评估表明,AddressVLM在这两个数据集上的平均地址定位准确率分别超过同类LVLMs的9%和12%。
引用
@article{arxiv.2508.10667,
title = {AddressVLM: Cross-view Alignment Tuning for Image Address Localization using Large Vision-Language Models},
author = {Shixiong Xu and Chenghao Zhang and Lubin Fan and Yuan Zhou and Bin Fan and Shiming Xiang and Gaofeng Meng and Jieping Ye},
journal= {arXiv preprint arXiv:2508.10667},
year = {2025}
}