中文

基于学习评分模型的遥感视觉语言数据质量驱动式精选

计算机视觉与模式识别 2025-09-22 v2

摘要

视觉语言模型(VLM)在通过语言引导语义来解释遥感(RS)图像方面显示出巨大的潜力。然而,这些VLM的效果严重依赖于能够捕捉视觉内容与语言描述之间富有语义关系的高质量图像文本训练数据。与自然图像不同,遥感图像缺乏来自网络数据的大规模交叉式图像文本对,使得数据收集具有挑战性。虽然当前方法主要依赖基于规则的方法或旗舰VLM进行数据合成,但缺乏针对此类人工生成RS视觉语言数据的自动化质量评估系统框架。为填补这一空白,我们提出了一种 novel score model,通过在大规模RS视觉语言偏好数据上进行训练,实现自动化质量评估。我们的实证结果表明,使用我们评分模型排名前30%的数据对CLIP或先进VLM(如Qwen2-VL)进行精细调优,可实现优于全量数据精细调优和CLIP-score-based排名方法的更高准确率。此外,我们展示了该评分模型在强化学习(RL)训练和最佳N(BoN)测试时扩展中的应用,显著提升了VLM在RS任务中的性能。我们的代码、模型和数据集已公开可用

关键词

引用

@article{arxiv.2503.00743,
  title  = {Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models},
  author = {Dilxat Muhtar and Enzhuo Zhang and Zhenshi Li and Feng Gu and Yanglangxing He and Pengfeng Xiao and Xueliang Zhang},
  journal= {arXiv preprint arXiv:2503.00743},
  year   = {2025}
}

备注

39 pages, 13 figures. Accept for NeruIPS2025