中文

迈向构建大规模多模态领域感知对话系统

计算与语言 2018-02-01 v3

摘要

尽管多模态对话代理在零售、旅游等多个领域的重要性日益增加,但由于缺乏大规模开放聊天记录,该领域的深度学习研究一直受到限制。为了克服这一瓶颈,本文引入了多模态领域感知对话任务,并提出了 MMD 基准数据集。该数据集是通过与零售领域大量领域专家密切合作收集的。这些专家提出了时尚领域多模态对话中常见的各种对话流程和对话状态。考虑到这些流程和状态,我们借助内部标注人员,通过半自动、高人工强度的迭代过程,创建了一个包含超过 15 万次购物者与销售代理之间对话会话的数据集。基于该数据集,我们提出了多模态对话的 5 个新子任务及其评估方法。我们还提出了编码-注意力-解码范式下的两个多模态神经模型,并展示了它们在两个子任务(即文本响应生成和最佳图像响应选择)上的性能。这些实验旨在确立基线性能,并为每个子任务开辟新的研究方向。此外,针对每个子任务,我们对 9 个最重要的对话状态进行了“逐状态评估”,这将有助于更有针对性地研究理解每个状态所涉及的挑战与复杂性。

关键词

引用

@article{arxiv.1704.00200,
  title  = {Towards Building Large Scale Multimodal Domain-Aware Conversation Systems},
  author = {Amrita Saha and Mitesh Khapra and Karthik Sankaranarayanan},
  journal= {arXiv preprint arXiv:1704.00200},
  year   = {2018}
}