从易到难:面向遥感数据视觉问答的语言引导课程学习
计算机视觉与模式识别
2022-06-15 v1
摘要
遥感场景的视觉问答(VQA)在智能人机交互系统中具有巨大潜力。尽管计算机视觉中的 VQA 已被广泛研究,面向遥感数据的 VQA(RSVQA)仍处于起步阶段。RSVQA 任务有两个需特别考虑的特征:1)RSVQA 数据集中无目标标注,导致模型难以利用信息区域表示;2)RSVQA 任务中每幅图像都存在难度明显不同的问题。直接用随机顺序的问题训练模型可能使模型混淆并限制性能。为解决这两个问题,本文提出一种多级视觉特征学习方法,联合提取语言引导的整体与区域图像特征。此外,开发了基于自步课程学习(SPCL)的 VQA 模型,以从易到难的方式训练网络。具体而言,本文探索了一种带软加权策略的语言引导 SPCL 方法。所提模型在三个公开数据集上评估,大量实验结果表明该 RSVQA 框架可取得良好性能。
引用
@article{arxiv.2205.03147,
title = {From Easy to Hard: Learning Language-guided Curriculum for Visual Question Answering on Remote Sensing Data},
author = {Zhenghang Yuan and Lichao Mou and Qi Wang and Xiao Xiang Zhu},
journal= {arXiv preprint arXiv:2205.03147},
year = {2022}
}