面向多模态影像的动态任务与权重优先课程学习
计算机视觉与模式识别
2023-11-08 v2 人工智能
摘要
本文探讨了利用以课程学习方法训练的多模态深度学习模型进行灾后分析。研究灾后分析十分重要,因其通过提供及时准确的损毁程度与资源调配洞察,在减轻灾害影响中发挥着关键作用。我们提出一种课程学习策略以提升多模态深度学习模型性能。课程学习通过让深度学习模型在渐趋复杂的数据上训练,模拟人类教育中的渐进学习序列。我们的首要目标是开发一个经课程训练的多模态深度学习模型,特别关注能够处理图像与文本联合数据的视觉问答(VQA),并结合基于 FloodNet 数据集的语义分割用于灾害分析。为此,U-Net 模型被用于语义分割与图像编码。一个定制构建的文本分类器被用于视觉问答。现有课程学习方法依赖人工定义的难度函数。我们引入一种称为动态任务与权重优先(DATWEP)的新型课程学习方法,其利用基于梯度的方法在课程学习训练期间自动判定任务难度,从而免除了显式难度计算之需。将 DATWEP 集成至我们的多模态模型显示出对 VQA 性能的提升。源代码见 https://github.com/fualsan/DATWEP。
引用
@article{arxiv.2310.19109,
title = {Dynamic Task and Weight Prioritization Curriculum Learning for Multimodal Imagery},
author = {Huseyin Fuat Alsan and Taner Arsan},
journal= {arXiv preprint arXiv:2310.19109},
year = {2023}
}