多模态对话状态跟踪
人工智能
2022-06-17 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
对话状态跟踪器旨在跟踪对话中的用户目标,是对话系统中的关键组件。然而,对话状态跟踪的研究很大程度上局限于单模态,其中槽位与槽值受知识领域限制(例如餐厅领域含餐厅名称和价格范围等槽位),并由特定数据库模式定义。在本文中,我们提出将对话状态跟踪的定义扩展至多模态。具体而言,我们引入一种新的对话状态跟踪任务,用于跟踪视频接地对话中所提及视觉对象的信息。每个新的对话话语可能引入新的视频片段、新的视觉对象或新的对象属性,状态跟踪器需相应更新这些信息槽。我们创建了一个新的合成基准,并为该任务设计了一种新的基线——视频-对话 Transformer 网络(VDTN)。VDTN 结合对象级特征与片段级特征,并学习视频与对话间的上下文依赖以生成多模态对话状态。我们将 VDTN 优化用于状态生成任务以及恢复视频片段或对象表示的自监督视频理解任务。最后,我们训练 VDTN 在响应预测任务中使用解码出的状态。结合全面的消融与定性分析,我们发现了构建更强大多模态对话系统的有趣见解。
引用
@article{arxiv.2206.07898,
title = {Multimodal Dialogue State Tracking},
author = {Hung Le and Nancy F. Chen and Steven C. H. Hoi},
journal= {arXiv preprint arXiv:2206.07898},
year = {2022}
}
备注
Accepted at NAACL 2022 (Oral)