中文

MemexQA:视觉记忆扩展问答

计算机视觉与模式识别 2017-08-07 v1 计算与语言

摘要

本文提出了一项新任务——MemexQA:给定用户的一组照片或视频,目标是自动回答有助于用户恢复对集合中所捕捉事件记忆的问题。为解决该任务,我们:1)发布了MemexQA数据集,这是一个由真实个人照片和众包问答组成的大规模、逼真的多模态数据集;2)提出了MemexNet,一个统一的、端到端可训练的网络架构,用于图像、文本和视频问答。在MemexQA数据集上的实验结果表明,MemexNet优于强基线方法,并在这项新颖且具有挑战性的任务上达到了当前最优水平。在TextQA和VideoQA上取得的良好结果显示了MemexNet在各种问答任务上的有效性和可扩展性。

关键词

引用

@article{arxiv.1708.01336,
  title  = {MemexQA: Visual Memex Question Answering},
  author = {Lu Jiang and Junwei Liang and Liangliang Cao and Yannis Kalantidis and Sachin Farfade and Alexander Hauptmann},
  journal= {arXiv preprint arXiv:1708.01336},
  year   = {2017}
}

备注

https://memexqa.cs.cmu.edu/