中文

Maria:一个由视觉体验驱动的对话智能体

计算与语言 2021-06-24 v2 人工智能

摘要

可以说,对话智能体对物理世界的视觉感知是其展现类人智能的关键途径之一,因此图像 grounding 对话被提出以应对该挑战。现有工作聚焦于探索将对话 grounding 于给定图像上的多模态对话模型。本文更进一步,在完全开放式的设定下研究图像 grounding 对话,该设定不假设存在配对的对话与图像。具体而言,我们提出 Maria,一个由从大规模图像索引中检索到的视觉世界体验所驱动的神经对话智能体。Maria 由三个灵活组件构成,即文本到图像检索器、视觉概念检测器和视觉知识 grounding 的回复生成器。检索器旨在从图像索引中为对话检索相关图像,而视觉概念检测器从图像中提取丰富的视觉知识。随后,回复生成器基于提取的视觉知识与对话上下文生成目标回复。大量实验表明,Maria 在自动指标和人工评估上均优于以往最先进的方法,并能生成具有物理世界视觉常识的信息丰富回复。

关键词

引用

@article{arxiv.2105.13073,
  title  = {Maria: A Visual Experience Powered Conversational Agent},
  author = {Zujie Liang and Huang Hu and Can Xu and Chongyang Tao and Xiubo Geng and Yining Chen and Fan Liang and Daxin Jiang},
  journal= {arXiv preprint arXiv:2105.13073},
  year   = {2021}
}

备注

Accepted by ACL 2021 main conference