中文

“你指的是什么?”评估多模态对话模型处理澄清性交互的能力

计算与语言 2023-07-31 v1

摘要

当指称表达未能为听话者唯一标识出意图指称对象时,对话中就会出现指称歧义。听话者通常会立即察觉此类歧义,并与说话者合作,使用元交际的澄清性交互(CE)来修复它:即一个澄清请求(CR)与一项回应。在此,我们主张,生成和回应 CR 的能力对多模态、基于视觉基础的对话模型的架构与目标函数施加了特定约束。我们使用 SIMMC 2.0 数据集来评估不同最先进模型架构处理 CE 的能力,所采用的度量探查了由 CE 在模型中引发的上下文更新。我们发现,基于语言的模型能够编码简单的多模态语义信息并处理某些 CE,在与对话历史相关的 CE 上表现突出;而多模态模型可利用额外的学习目标获得解耦的对象表示,这些表示对于整体处理跨模态的复杂指称歧义至关重要。

关键词

引用

@article{arxiv.2307.15554,
  title  = {'What are you referring to?' Evaluating the Ability of Multi-Modal Dialogue Models to Process Clarificational Exchanges},
  author = {Javier Chiyah-Garcia and Alessandro Suglia and Arash Eshghi and Helen Hastie},
  journal= {arXiv preprint arXiv:2307.15554},
  year   = {2023}
}

备注

Accepted at SIGDIAL'23 (upcoming). Repository with code and experiments available at https://github.com/JChiyah/what-are-you-referring-to