中文

VD-BERT:一种基于 BERT 的统一视觉与对话 Transformer

计算机视觉与模式识别 2020-11-03 v3 计算与语言

摘要

视觉对话是一项具有挑战性的视觉-语言任务,对话智能体需要通过基于图像内容和对话历史进行推理来回答一系列问题。先前的工作大多集中于各种注意力机制以建模这种复杂的交互。相比之下,在本工作中,我们提出 VD-BERT,一种简单而有效的统一视觉-对话 Transformer 框架,利用预训练的 BERT 语言模型用于视觉对话任务。该模型之所以统一,是因为:(1) 它使用单流 Transformer 编码器捕获图像与多轮对话之间的所有交互;(2) 它通过相同架构无缝支持答案排序与答案生成。更关键的是,我们通过视觉接地训练将 BERT 适配于视觉与对话内容的有效融合。无需在外部视觉-语言数据上预训练,我们的模型取得了新的最优结果,在视觉对话排行榜的单模型和集成设置(NDCG 分数分别为 74.54 和 75.35)中均位居榜首。我们的代码和预训练模型发布于 https://github.com/salesforce/VD-BERT。

关键词

引用

@article{arxiv.2004.13278,
  title  = {VD-BERT: A Unified Vision and Dialog Transformer with BERT},
  author = {Yue Wang and Shafiq Joty and Michael R. Lyu and Irwin King and Caiming Xiong and Steven C. H. Hoi},
  journal= {arXiv preprint arXiv:2004.13278},
  year   = {2020}
}

备注

EMNLP 2020 (14 pages)