中文

无对话数据的对话:从视觉问答数据学习视觉对话智能体

计算机视觉与模式识别 2020-07-28 v1 人工智能 计算与语言

摘要

我们能否开发出能够高效适应新任务而不忘记如何与人交谈的视觉基础对话智能体?这样的智能体可以利用更多种类的现有数据来泛化到新任务,从而最小化昂贵的数据收集和标注成本。在这项工作中,我们研究了一个我们称之为“无对话数据的对话”的设置,该设置要求智能体开发出能够在没有语言层面监督的情况下适应新任务的视觉基础对话模型。通过分解意图和语言,我们的模型在针对新任务进行微调后,最大限度地减少了语言漂移。我们给出了定性结果、自动化指标和人类研究,这些均表明我们的模型能够适应新任务并保持语言质量。基线模型要么在新任务上表现不佳,要么经历语言漂移,变得让人类难以理解。代码已开源,地址为 https://github.com/mcogswell/dialog_without_dialog。

关键词

引用

@article{arxiv.2007.12750,
  title  = {Dialog without Dialog Data: Learning Visual Dialog Agents from VQA Data},
  author = {Michael Cogswell and Jiasen Lu and Rishabh Jain and Stefan Lee and Devi Parikh and Dhruv Batra},
  journal= {arXiv preprint arXiv:2007.12750},
  year   = {2020}
}

备注

19 pages, 8 figures