中文

WDMIR:基于小波驱动的多模态意图识别

多媒体 2025-06-13 v1 人工智能 计算机视觉与模式识别 信号处理

摘要

多模态意图识别(MIR)旨在通过整合视频、音频和文本模态中的语言与非语言信息来准确解读用户意图。虽然现有方法优先考虑文本分析,但它们往往忽略了嵌入在非语言线索中的丰富语义内容。本文提出了一种新颖的基于小波驱动的多模态意图识别(WDMIR)框架,通过非语言信息的频域分析来增强意图理解。具体而言,我们提出:(1)一个小波驱动的融合模块,在频域中对视频-音频特征进行同步分解与集成,实现对时间动力学的细粒度分析;(2)一个跨模态交互机制,促进从双模态到三模态集成的渐进特征增强,有效弥合语言信息与非语言信息之间的语义鸿沟。在MIntRec数据集上的大量实验表明,我们的方法达到了最先进的性能,在准确率上超越了先前方法1.13%。消融研究进一步验证了小波驱动融合模块在从非语言来源提取语义信息方面的显著作用,在分析细微情感线索时识别准确率提升了0.41%。

关键词

引用

@article{arxiv.2506.10011,
  title  = {WDMIR: Wavelet-Driven Multimodal Intent Recognition},
  author = {Weiyin Gong and Kai Zhang and Yanghai Zhang and Qi Liu and Xinjie Sun and Junyu Lu and Linbo Zhu},
  journal= {arXiv preprint arXiv:2506.10011},
  year   = {2025}
}

备注

Accepted at IJCAI 2025, 9pages, 6figures