AeroLite:面向航空图像的标签引导的轻量级caption生成
计算机视觉与模式识别
2025-04-15 v1 多媒体
摘要
准确自动化地为航空图像生成描述对于环境监测、城市规划和灾害管理等应用至关重要。然而,这一任务因复杂的空间语义和领域变异性仍具有挑战。为此,我们引入了 AeroLite,一个轻量级、标签引导的caption生成框架,旨在为远程感知图像专为小规模语言模型(1--3B 参数)提供稳健且可解释的caption能力。AeroLite 利用 GPT-4o 生成大规模、语义丰富的伪caption 数据集,通过整合多个远程感知基准数据集(包括 DLRSD、iSAID、LoveDA、WHU 和 RSSCN7)。为显式捕获如方向和土地利用类型等关键语义元素,AeroLite 采用自然语言处理技术提取相关语义标签。这些标签由专用多标签 CLIP 编码器学习,以确保精确的语义预测。为有效融合视觉和语义信息,我们提出了一种新颖的桥接多层感知器(MLP)架构,对齐语义标签与视觉嵌入,同时保持最小的计算开销。AeroLite 的灵活设计还支持无缝集成到各种预训练大型语言模型中。我们采用两阶段基于 LoRA 的训练方法:初始阶段利用伪caption 数据集捕获广泛的远程感知语义,随后在较小的精选数据集(如 UCM 和 Sydney Captions)上进行微调,以细化领域特定的对齐。实验评估表明,AeroLite 在标准caption 指标(包括 BLEU 和 METEOR)上显著优于更大规模的模型(例如 13B 参数),同时保持显著更低的计算成本。
引用
@article{arxiv.2504.09528,
title = {AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions},
author = {Xing Zi and Tengjun Ni and Xianjing Fan and Xian Tao and Jun Li and Ali Braytee and Mukesh Prasad},
journal= {arXiv preprint arXiv:2504.09528},
year = {2025}
}