中文

MAGIC:面向多样且非配对文本图像描述的多模态关系图对抗推理

计算机视觉与模式识别 2022-03-07 v2 人工智能

摘要

基于文本的图像描述(TextCap)需要同时理解视觉内容并读取图像中的文本以生成自然语言描述。尽管该任务可进一步教会机器理解复杂的人类环境(鉴于文本在我们日常环境中无处不在),但它给常规描述生成带来了额外挑战。基于文本的图像直观地包含丰富而复杂的多模态关系内容,即图像细节可从多视角而非单一描述被多样地刻画。当然,我们可以引入额外的配对训练数据来展示图像描述的多样性,但这一过程对于带有额外文本的TextCap配对标注而言是劳动密集且耗时的。基于上述见解,我们研究了如何使用非配对训练范式来生成聚焦于不同图像区域的多样描述。我们提出了用于多样且非配对TextCap的多模态关系图对抗推理(MAGIC)框架。该框架可自适应地构建图像的多个多模态关系图,并对图间复杂关系建模以表征描述多样性。此外,在所建图的基础上开发了级联生成对抗网络,以在图像-句子特征对齐和语言连贯性层面上推理非配对描述的生成。我们验证了MAGIC从图像不同关系信息项生成多样描述的有效性。实验结果表明,MAGIC可在不使用任何图像-描述训练对的情况下生成极具前景的结果。

关键词

引用

@article{arxiv.2112.06558,
  title  = {MAGIC: Multimodal relAtional Graph adversarIal inferenCe for Diverse and Unpaired Text-based Image Captioning},
  author = {Wenqiao Zhang and Haochen Shi and Jiannan Guo and Shengyu Zhang and Qingpeng Cai and Juncheng Li and Sihui Luo and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2112.06558},
  year   = {2022}
}