MMIU:多模态助手中的视觉意图理解数据集
计算机视觉与模式识别
2021-11-02 v2 机器学习
摘要
在多模态助手中,视觉也是输入模态之一,用户意图的识别因视觉输入可能影响结果而变得具有挑战性。当前的数字助手接收语音输入,并试图从对话或设备上下文中确定用户意图。因此,包含视觉输入(即针对多模态助手用例的相应问题所对应的图像或视频)的数据集尚不易获得。视觉问答(VQA)和视觉问题生成(VQG)的研究是向前迈出的一大步。然而,它们并未涵盖有视觉能力的人会向多模态助手提出的问题。此外,许多时候问题并不寻求来自外部知识的信息。在本文中,我们提供了一个新的数据集 MMIU(多模态意图理解),其中包含人类标注者在观看图像时提供的问题及相应意图。随后,我们将该数据集用于多模态数字助手中的意图分类任务。我们还尝试了多种融合视觉与语言特征的方法,包括使用多模态 transformer 将图像-问题对分类为 14 种意图。我们提供了基准结果,并讨论了视觉与文本特征在我们数据集上意图分类任务中的作用。
引用
@article{arxiv.2110.06416,
title = {MMIU: Dataset for Visual Intent Understanding in Multimodal Assistants},
author = {Alkesh Patel and Joel Ruben Antony Moniz and Roman Nguyen and Nick Tzou and Hadas Kotek and Vincent Renkens},
journal= {arXiv preprint arXiv:2110.06416},
year = {2021}
}
备注
Extended abstract accepted for WeCNLP 2021