MIntRec:一个用于多模态意图识别的新数据集
人工智能
2023-02-09 v1
摘要
多模态意图识别是在真实多模态场景中理解人类语言的一项重要任务。由于现有基准数据集仅含文本信息的限制,大多数已有的意图识别方法在利用多模态信息方面存在局限。本文引入了一个用于多模态意图识别的新数据集(MIntRec)以解决该问题。它基于从电视剧《Superstore》收集的数据,构建了粗粒度与细粒度的意图分类体系。该数据集包含2,224个具有文本、视频和音频模态的高质量样本,并在二十个意图类别上进行了多模态标注。此外,我们提供了每个视频片段中说话人的标注边界框,并实现了说话人标注的自动化流程。MIntRec有助于研究者挖掘不同模态间的关系以增强意图识别能力。我们从各模态提取特征,并通过适配三种强大的多模态融合方法来建模跨模态交互以构建基线。大量实验表明,与仅用文本模态相比,使用非言语模态取得了实质性提升,证明了利用多模态信息进行意图识别的有效性。最佳执行方法与人类之间的差距表明了该任务对学界而言的挑战性与重要性。完整数据集与代码可在 https://github.com/thuiar/MIntRec 获取。
引用
@article{arxiv.2209.04355,
title = {MIntRec: A New Dataset for Multimodal Intent Recognition},
author = {Hanlei Zhang and Hua Xu and Xin Wang and Qianrui Zhou and Shaojie Zhao and Jiayan Teng},
journal= {arXiv preprint arXiv:2209.04355},
year = {2023}
}
备注
Accepted by ACM MM 2022 (Main Track, Long Paper)