中文

X-GGM:用于视觉问答中分布外泛化的图生成建模

计算机视觉与模式识别 2021-10-05 v2 多媒体

摘要

近年来视觉问答(VQA)取得了令人鼓舞的进展,但使VQA模型自适应地泛化到分布外(OOD)样本仍具挑战。直观上,已有视觉概念(即属性与物体)的重新组合可生成训练集中未出现的组合,这将促进VQA模型泛化到OOD样本。本文将VQA中的OOD泛化表述为组合泛化问题,并提出一种基于图生成建模的训练方案(X-GGM)来隐式建模该问题。X-GGM利用图生成建模为以属性-物体对为节点的预定义图迭代生成关系矩阵与节点表示。此外,为缓解图生成建模中的训练不稳定问题,我们提出梯度分布一致性损失,以约束带对抗扰动的数据分布与生成分布。采用X-GGM方案训练的基线VQA模型(LXMERT)在两个标准VQA OOD基准(即VQA-CP v2与GQA-OOD)上取得了最先进的OOD性能。大量消融研究证明了X-GGM各组件的有效性。代码见\url{https://github.com/jingjing12110/x-ggm}。

关键词

引用

@article{arxiv.2107.11576,
  title  = {X-GGM: Graph Generative Modeling for Out-of-Distribution Generalization in Visual Question Answering},
  author = {Jingjing Jiang and Ziyi Liu and Yifan Liu and Zhixiong Nan and Nanning Zheng},
  journal= {arXiv preprint arXiv:2107.11576},
  year   = {2021}
}

备注

Accepted by ACM MM2021