中文

遥感中的视觉-语言模型:当前进展与未来趋势

计算机视觉与模式识别 2024-04-03 v2 人工智能

摘要

ChatGPT 和 GPT-4 的卓越成就引发了面向通用人工智能(AGI)的大语言模型领域的兴趣与研究浪潮。这些模型提供了接近人类思维的智能解决方案,使我们能够利用通用人工智能解决各类应用中的问题。然而,在遥感(RS)领域,关于 AGI 实现的科学文献仍相对稀少。遥感中现有的 AI 相关研究主要关注视觉理解任务,而忽视了对象及其关系的语义理解。这正是视觉-语言模型所擅长的,因为它们能够对图像及其关联文本描述进行推理,从而实现对底层语义的更深理解。视觉-语言模型可以超越 RS 图像的视觉识别,建模语义关系并生成图像的自然语言描述。这使它们更适用于需要视觉与文本理解的任务,如图像字幕生成与视觉问答。本文对遥感中视觉-语言模型的研究进行了全面综述,总结最新进展,强调挑战,并指出潜在的研究机会。

关键词

引用

@article{arxiv.2305.05726,
  title  = {Vision-Language Models in Remote Sensing: Current Progress and Future Trends},
  author = {Xiang Li and Congcong Wen and Yuan Hu and Zhenghang Yuan and Xiao Xiang Zhu},
  journal= {arXiv preprint arXiv:2305.05726},
  year   = {2024}
}

备注

Accepted by IEEE Geoscience and Remote Sensing Magazine