中文

X-LXMERT:利用多模态Transformer进行绘画、描述与问答

计算机视觉与模式识别 2020-09-24 v1 人工智能 计算与语言 机器学习

摘要

借鉴掩码语言模型的成功,ViLBERT、LXMERT和UNITER等视觉与语言对应模型在视觉问答和视觉定位等多种多模态判别任务上取得了最先进的性能。近期工作也成功地将此类模型适配到图像描述这一生成任务中。这引出了一个问题:这些模型能否反向从文本片段生成图像?我们对这一模型家族中一个流行的代表——LXMERT——的分析发现,在其当前训练设置下,它无法生成丰富且语义有意义的图像。我们提出了X-LXMERT,一种对LXMERT的扩展,其训练改进包括:离散化视觉表示、使用具有大范围掩码比例的均匀掩码,以及将正确的预训练数据集与正确的目标对齐,从而使其具备绘画能力。X-LXMERT的图像生成能力可与最先进的生成模型相媲美,而其问答和描述能力仍与LXMERT相当。最后,我们通过将图像生成能力加入UNITER以产生X-UNITER,展示了这些训练改进的通用性。

关键词

引用

@article{arxiv.2009.11278,
  title  = {X-LXMERT: Paint, Caption and Answer Questions with Multi-Modal Transformers},
  author = {Jaemin Cho and Jiasen Lu and Dustin Schwenk and Hannaneh Hajishirzi and Aniruddha Kembhavi},
  journal= {arXiv preprint arXiv:2009.11278},
  year   = {2020}
}

备注

EMNLP 2020