面向多模态意图理解的多模态分类与分布外检测
多媒体
2025-05-26 v2
摘要
多模态意图理解是一个重要的研究领域,需要有效利用多种模态来分析人类语言。现有方法在该领域面临两个主要挑战。首先,它们在捕捉复杂分布内 (ID) 多模态意图背后细微且高层次的语义方面存在局限性。其次,在现实场景中面对未见过的分布外 (OOD) 数据时,它们表现出较差的泛化能力。为了解决这些问题,我们提出了一种同时用于 ID 分类和 OOD 检测的新方法 (MIntOOD)。我们首先引入一个加权特征融合网络来建模多模态表示。该网络动态学习每个模态的重要性,以适应多模态上下文。为了针对这两个任务开发判别性表示,我们从 ID 数据的凸组合中合成伪 OOD 数据,并从粗粒度和细粒度两个视角进行多模态表示学习。粗粒度视角侧重于区分 ID 和 OOD 二分类,而细粒度视角不仅增强了不同 ID 类别之间的判别能力,还捕捉了 ID 和 OOD 样本之间的实例级交互,促进相似实例之间的接近与不同实例之间的分离。我们为三个多模态意图数据集建立了基线,并构建了一个 OOD 基准。在这些数据集上的大量实验表明,我们的方法显著提高了 OOD 检测性能,AUROC 分数提高了 3~10%,同时在 ID 分类上取得了新的 SOTA 结果。数据和代码可在 https://github.com/thuiar/MIntOOD 获取。
引用
@article{arxiv.2412.12453,
title = {Multimodal Classification and Out-of-distribution Detection for Multimodal Intent Understanding},
author = {Hanlei Zhang and Qianrui Zhou and Hua Xu and Jianhua Su and Roberto Evans and Kai Gao},
journal= {arXiv preprint arXiv:2412.12453},
year = {2025}
}
备注
Accepted by IEEE Transactions on Multimedia