中文

BERT 看到了什么:面向视觉问题生成的跨模态迁移

计算与语言 2020-12-17 v3 计算机视觉与模式识别 机器学习

摘要

预训练语言模型近来推动了 NLP 任务的显著进展。近期开发了 BERT 的多模态版本,利用依赖大量对齐文本与图像数据的重度预训练,主要应用于 VQA 等分类任务。本文中,我们旨在通过避免对补充数据上的预训练,评估 BERT 开箱即用的视觉能力。我们选择研究视觉问题生成——一个对具身对话极具意义、且能考察各模态影响(因输入可为视觉和/或文本)的任务。此外,该任务的生成特性需要一种适配,因为 BERT 主要被设计为编码器。我们引入 BERT-gen,一种基于 BERT 的文本生成架构,能够利用单模态或多模态表示。不同配置下报告的结果表明,BERT-gen 具有适应多模态数据与文本生成的先天能力,即便在可用数据稀少时亦能避免昂贵的预训练。所提模型在两个成熟的 VQG 数据集上相较最先进水平取得了实质性改进。

关键词

引用

@article{arxiv.2002.10832,
  title  = {What BERT Sees: Cross-Modal Transfer for Visual Question Generation},
  author = {Thomas Scialom and Patrick Bordes and Paul-Alexis Dray and Jacopo Staiano and Patrick Gallinari},
  journal= {arXiv preprint arXiv:2002.10832},
  year   = {2020}
}

备注

INLG 2020