中文

在视觉问答上达到人类水平

计算与语言 2021-11-22 v3 计算机视觉与模式识别

摘要

视觉问答(VQA)任务利用视觉图像与语言分析,针对图像回答文本问题。在过去十年中,它已成为一个热门研究课题,并拥有越来越多的现实世界应用。本文描述了我们近期关于 AliceMind-MMU(达摩院机器智能实验室的编码器-解码器集合——多媒体理解)的研究,该模型在 VQA 上取得了与人类相似甚至略优的结果。这是通过系统性改进 VQA 流程实现的,包括:(1)利用全面的视觉与文本特征表示进行预训练;(2)通过学会注意力实现有效的跨模态交互;以及(3)针对复杂 VQA 任务、带有专用专家模块的新颖知识挖掘框架。以相应所需专业知识处理不同类型的视觉问答,在将我们的 VQA 架构性能提升至人类水平方面起到了重要作用。我们进行了广泛的实验与分析以证明该新研究工作的有效性。

关键词

引用

@article{arxiv.2111.08896,
  title  = {Achieving Human Parity on Visual Question Answering},
  author = {Ming Yan and Haiyang Xu and Chenliang Li and Junfeng Tian and Bin Bi and Wei Wang and Weihua Chen and Xianzhe Xu and Fan Wang and Zheng Cao and Zhicheng Zhang and Qiyu Zhang and Ji Zhang and Songfang Huang and Fei Huang and Luo Si and Rong Jin},
  journal= {arXiv preprint arXiv:2111.08896},
  year   = {2021}
}