超越指标偏见的遥感图像描述评估
计算机视觉与模式识别
2026-04-28 v1
摘要
图像描述的核心目标是实现从视觉信号到文本模态的无损语义压缩。然而,依赖人工精选参考文本的评估方法本质上迫使模型模仿特定的人类标注风格,从而掩盖了先进基础模型的真实描述能力。这种系统性偏离引出一个关键问题:针对遥感图像描述,是否真的需要进行任务特定的微调,还是感知到的性能差距仅是评估标准不当的结果?为调查这一差异,我们提出了一种新的无参考评估指标——ReconScore。该指标不计算文本相似度,而是评估描述能否仅凭生成的文本重建原始视觉元素,从而中和人类标注偏见。应用该指标,我们发现一种内在强大的、未经微调的大语言模型在真正的零样本遥感图像描述任务中超越了其微调后模型。基于这一结构性发现,我们引入了 RemoteDescriber,这是一种完全无训练的生成方法。通过将 ReconScore 作为自我纠正机制,我们在不引入计算微调开销的情况下迭代细化大语言模型输出的语义精确度。全面实验表明,RemoteDescriber 在三个数据集上实现了最先进的性能。进一步验证了 ReconScore 的可靠性并分析了传统指标的缺陷。我们的代码已公开于 https://github.com/hhu-czy/RemoteDescriber。
引用
@article{arxiv.2604.22855,
title = {Evaluating Remote Sensing Image Captions Beyond Metric Biases},
author = {Ziyun Chen and Fan Liu and Liang Yao and Chuanyi Zhang and Yuye Ma and Wei Zhou},
journal= {arXiv preprint arXiv:2604.22855},
year = {2026}
}