视觉对话的大规模预训练:一个简洁的当前最优基线
机器学习
2020-04-01 v2 计算与语言
计算机视觉与模式识别
机器学习
摘要
先前视觉对话的工作集中于在 VisDial 上孤立地训练深度神经模型。相反,我们提出一种方法,在迁移到视觉对话之前,先在与视觉-语言相关的数据集上预训练。我们适配了最近提出的 ViLBERT (Lu et al., 2019) 模型用于多轮视觉接地对话。我们的模型在 Conceptual Captions 和 Visual Question Answering 数据集上预训练,并在 VisDial 上微调。我们最好的单一模型在 NDCG 和 MRR 上比先前发表的工作(包括模型集成)绝对高出 1% 以上。接下来,我们发现使用 VisDial 中的“密集”标注进行额外微调可带来更高的 NDCG——比我们的基础模型高出 10% 以上——但损害了 MRR——比我们的基础模型低 17% 以上!这凸显了两个主要指标 NDCG 与 MRR 之间的权衡,我们发现这是由于密集标注与问题的原始真实答案相关性不佳所致。
引用
@article{arxiv.1912.02379,
title = {Large-scale Pretraining for Visual Dialog: A Simple State-of-the-Art Baseline},
author = {Vishvak Murahari and Dhruv Batra and Devi Parikh and Abhishek Das},
journal= {arXiv preprint arXiv:1912.02379},
year = {2020}
}