面向远程感知图像描述的多语言视觉语言学习基准
计算机视觉与模式识别
2025-03-07 v1
摘要
远程感知图像描述(RSIC)是一个跨模态领域,旨在自动生成远程感知图像中特征和场景的自然语言描述。尽管在为视觉语言模型(VLMs)开发先进方法和大规模数据集方面取得了显著进展,但仍存在两个关键挑战:非英文描述数据集的稀缺以及模型多语言能力评估的缺失。这些限制在 LLM 时代的进步和实际部署中至关重要。为此,本文对该领域做出了几个重要贡献。首先,我们引入并分析了 BRSIC(Bilingual Remote Sensing Image Captioning),一个综合性的双语数据集,丰富了三个已建立的英文 RSIC 数据集,包含 13,634 张图像配对 68,170 条双语标题。基于此基础,我们开发了一个系统性的评估框架,解决了评估协议普遍不一致的问题,通过标准化的在 BRSIC 上的重新训练程序,对模型性能进行严格评估。此外,我们对八个最先进的大型视觉语言模型(LVLMs)进行了广泛实证研究,检验其在包括零样本推理、监督微调和多语言训练等多个范式下的能力。该全面评估为当前 LVLMs 在处理多语言远程感知任务方面的优势和局限性提供了关键见解。此外,我们的跨数据集转移实验揭示了有趣的发现。代码和数据将在 https://github.com/mrazhou/BRSIC 提供。
引用
@article{arxiv.2503.04592,
title = {A Benchmark for Multi-Lingual Vision-Language Learning in Remote Sensing Image Captioning},
author = {Qing Zhou and Tao Yang and Junyu Gao and Weiping Ni and Junzheng Wu and Qi Wang},
journal= {arXiv preprint arXiv:2503.04592},
year = {2025}
}