TECO:基于常识知识抽取的文本增强多模态意图识别
计算与语言
2024-12-12 v1
摘要
多模态意图识别(MIR)的目标是利用文本、视频和音频等多种模态来检测用户意图,这对于理解对话系统中的人类语言和上下文至关重要。尽管该领域取得了进展,但仍存在两个主要挑战:(1)有效地提取和利用来自稳健文本特征的语义信息;(2)有效地对齐和融合非语言模态与语言模态。本文提出了一种基于常识知识抽取的文本增强方法(TECO),以解决上述挑战。我们首先从生成的知识和检索到的知识中提取关系,以丰富文本模态中的上下文信息。随后,我们将视觉和声学表示与这些增强后的文本特征对齐和集成,以形成统一的多模态表示。我们的实验结果显示,相较于现有的基线方法,TECO 能够显著提升多模态意图识别的性能。
引用
@article{arxiv.2412.08529,
title = {TECO: Improving Multimodal Intent Recognition with Text Enhancement through Commonsense Knowledge Extraction},
author = {Quynh-Mai Thi Nguyen and Lan-Nhi Thi Nguyen and Cam-Van Thi Nguyen},
journal= {arXiv preprint arXiv:2412.08529},
year = {2024}
}
备注
Accepted at PACLIC 2024