中文

重新思考用于鲁棒视觉问答的数据增强

计算机视觉与模式识别 2022-09-16 v2 人工智能 计算与语言 多媒体

摘要

数据增强(DA)——在原始训练集之外生成额外训练样本——在当今无偏VQA模型中已被广泛用于缓解语言偏差。当前主流的DA策略是基于合成的方法,其通过编辑某些视觉区域/词语或从零开始重新生成来合成新样本。然而,这些合成样本总是不自然且易出错。为避免此问题,最近的一项DA工作通过将原始图像与其他人工撰写的问题随机配对来组成新的增强样本。遗憾的是,为保证增强样本具有合理的真实答案,他们针对若干问题类型手动设计了一组启发式规则,这极大限制了其泛化能力。为此,我们提出一种新的基于知识蒸馏的VQA数据增强方法,称为KDDAug。具体而言,我们首先放宽合理图像-问题对的要求,使其可轻松应用于任意问题类型。然后,我们设计一种基于知识蒸馏(KD)的答案分配方法,为所有组成的图像-问题对生成伪答案,这些伪答案在域内和分布外设置下均具有鲁棒性。由于KDDAug是一种模型无关的DA策略,它可无缝集成到任意VQA架构中。在多个主干网络和基准上的大量消融研究已证明了KDDAug的有效性和泛化能力。

关键词

引用

@article{arxiv.2207.08739,
  title  = {Rethinking Data Augmentation for Robust Visual Question Answering},
  author = {Long Chen and Yuhang Zheng and Jun Xiao},
  journal= {arXiv preprint arXiv:2207.08739},
  year   = {2022}
}

备注

Accepted to ECCV 2022; Codes: https://github.com/ItemZheng/KDDAug