A-MESS:基于锚点的多模态嵌入与语义同步用于多模态意图识别
计算机视觉与模式识别
2025-04-03 v2 人工智能
摘要
在多模态意图识别(MIR)领域,目标是通过整合语言文本、身体姿态和语调等多种模态来识别人类意图。然而,现有方法难以充分捕捉模态间的内在联系,并忽略了意图的相应语义表示。为解决这些局限,我们提出了基于锚点的多模态嵌入与语义同步(A-MESS)框架。我们首先设计了一个基于锚点的多模态嵌入(A-ME)模块,采用基于锚点的嵌入融合机制来整合多模态输入。此外,我们开发了一种语义同步(SS)策略,结合三元组对比学习流程,通过将多模态表示与大语言模型生成的标签描述同步来优化过程。大量实验表明,我们的A-MESS达到了最先进水平,并为多模态表示及下游任务提供了深刻见解。
引用
@article{arxiv.2503.19474,
title = {A-MESS: Anchor based Multimodal Embedding with Semantic Synchronization for Multimodal Intent Recognition},
author = {Yaomin Shen and Xiaojian Lin and Wei Fan},
journal= {arXiv preprint arXiv:2503.19474},
year = {2025}
}
备注
Accepted by ICME2025