中文

DyKen-Hyena: 基于跨模态注意力的动态核生成用于多模态意图识别

机器学习 2025-09-15 v1

摘要

尽管多模态意图识别(Multimodal Intent Recognition, MIR)通过利用来自语言、视频和音频等多种来源的丰富信息证明了其有效性,但跨模态中与意图无关且冲突的信息的潜在影响可能阻碍性能的进一步提升。当前大多数模型试图通过将多头注意力等机制应用于单模态特征序列,然后将结果加回原始表示来融合模态。这一过程存在用嘈杂或无关的非语言信号破坏主要语言特征的风险,因为其通常无法捕捉细粒度的、token 级别的影响——在此影响下,非语言线索应当调节而不仅是增强文本含义。为解决这一问题,我们引入了 DyKen-Hyena,将问题从特征融合重新构建为处理调制。我们的模型将视听线索转化为动态的、逐 token 的卷积核,直接调制文本特征提取。这种细粒度的方法在 MIntRec 和 MIntRec2.0 基准上取得了 state-of-the-art 的结果。值得注意的是,它在域外检测中实现了 +10.46% 的 F1 分数提升,验证了我们的方法从根本上创建了更鲁棒的意图表示。

关键词

引用

@article{arxiv.2509.09940,
  title  = {DyKen-Hyena: Dynamic Kernel Generation via Cross-Modal Attention for Multimodal Intent Recognition},
  author = {Yifei Wang and Wenbin Wang and Yong Luo},
  journal= {arXiv preprint arXiv:2509.09940},
  year   = {2025}
}

备注

8 pages, 2 figures