中文

零样本迁移 VQA 数据集

人工智能 2018-11-05 v1 计算与语言

摘要

习得大量词汇是人类智能的一个重要方面。人类扩充词汇的一种常见方法是在阅读或聆听时学习单词,然后在写作或说话时使用它们。这种从输入到输出的迁移能力对人类而言是自然的事,但对机器却很困难。人类在诸如视觉问答(VQA)等复杂多模态任务中自发地进行此类知识迁移。为接近人类水平的人工智能,我们希望赋予机器此种能力。因此,为加速该研究,我们提出一个新的零样本迁移 VQA(ZST-VQA)数据集,其通过重组现有 VQA v1.0 数据集得到:在训练中,某些词仅出现在一个模块(即问题)中而不出现在另一个模块(即答案)中。在此设定下,智能模型应从一个模块(即问题)理解并学习概念,并在测试时将其迁移到另一个模块(即作为答案预测概念)。我们使用三种现有最先进 VQA 神经模型在该新数据集上进行了评估。实验结果显示在该数据集上性能显著下降,表明现有方法未解决零样本迁移问题。此外,我们的分析发现这可能是由于训练期间学到的隐式偏差所致。

关键词

引用

@article{arxiv.1811.00692,
  title  = {Zero-Shot Transfer VQA Dataset},
  author = {Yuanpeng Li and Yi Yang and Jianyu Wang and Wei Xu},
  journal= {arXiv preprint arXiv:1811.00692},
  year   = {2018}
}