中文

视觉问答的技巧与窍门:来自 2017 挑战赛的经验

计算机视觉与模式识别 2017-08-10 v1 计算与语言

摘要

本文提出了一种用于视觉问答(VQA)的 state-of-the-art 模型,该模型在 2017 VQA Challenge 中获得第一名。鉴于其多模态特性、明确的评估协议以及潜在的现实世界应用,VQA 是人工智能研究中具有重要意义的一项任务。用于 VQA 的深度神经网络的性能非常依赖于架构和超参数的选择。为了帮助该领域的进一步研究,我们详细描述了我们高性能但相对简单的模型。通过对代表超过 3,000 GPU 小时的架构和超参数进行大规模探索,我们确定了促成其成功的技巧和窍门,即:sigmoid 输出、软训练目标、来自 bottom-up attention 的图像特征、门控 tanh 激活函数、使用 GloVe 和 Google Images 初始化的输出嵌入、大批量大小以及训练数据的智能打乱。我们对其性能影响进行了详细分析,以协助他人做出合适的选择。

关键词

引用

@article{arxiv.1708.02711,
  title  = {Tips and Tricks for Visual Question Answering: Learnings from the 2017 Challenge},
  author = {Damien Teney and Peter Anderson and Xiaodong He and Anton van den Hengel},
  journal= {arXiv preprint arXiv:1708.02711},
  year   = {2017}
}

备注

Winner of the 2017 Visual Question Answering (VQA) Challenge at CVPR