中文

用于视觉问答的跨模态生成式增强

计算机视觉与模式识别 2021-10-26 v2 计算与语言

摘要

数据增强已被证明能有效提升多模态机器学习模型的性能。本文引入一种利用多模态间相关性的生成式数据增强模型。不同于采用确定性启发式低层操作的传统数据增强方法,我们的方法在变分自编码器框架中学习一个以观测模态为条件生成目标模态样本的生成器。此外,所提模型能够通过其生成概率量化增强数据的置信度,并可与下游任务联合优化。以视觉问答作为下游任务的实验证明了该生成式模型的有效性,其能够改进基于强 UpDn 的模型以达到最先进的性能。

关键词

引用

@article{arxiv.2105.04780,
  title  = {Cross-Modal Generative Augmentation for Visual Question Answering},
  author = {Zixu Wang and Yishu Miao and Lucia Specia},
  journal= {arXiv preprint arXiv:2105.04780},
  year   = {2021}
}

备注

BMVC 2021