远程感知中高效少样本学习:融合视觉与视觉-语言模型
计算机视觉与模式识别
2025-10-17 v1 人工智能
机器学习
摘要
远程感知已成为城市规划、环境监测和灾害响应等领域的重要工具。尽管数据生成量显著增加,但传统视觉模型常受限于需要大量领域特定标注数据以及其在复杂环境中理解情境的有限能力。视觉-语言模型(VLMs)提供了一种互补方法,通过整合视觉和文本数据;然而,其在远程感知中的应用仍属探索阶段,尤其是鉴于其通用性。本工作旨在探讨视觉模型与VLMs的结合,以增强远程感知中的图像分析,聚焦于飞机检测和场景理解。将YOLO与VLMs如LLaVA、ChatGPT和Gemini集成,旨在实现对图像解释的更高精度和情境感知能力。在标注数据、未标注远程感知数据以及降质图像情境下评估性能,这些情境在远程感知中尤为关键。结果表明,在飞机检测和计数准确率方面,各模型在挑战性情境下的平均MAE改进了48.46%,尤其在原始和降质情境下效果显著。在对远程感知图像进行综合理解方面,CLIPScore提升了6.17%。将传统视觉模型与VLMs相结合的所提出的方法为更先进且高效的远程感知图像分析开辟了道路,尤其是在少样本学习情境下。
引用
@article{arxiv.2510.13993,
title = {Efficient Few-Shot Learning in Remote Sensing: Fusing Vision and Vision-Language Models},
author = {Jia Yun Chua and Argyrios Zolotas and Miguel Arana-Catania},
journal= {arXiv preprint arXiv:2510.13993},
year = {2025}
}
备注
11 pages, 7 figures, 8 tables. To be published in Applied AI Letters