中文

面向多模态参与度估计的对话感知选择状态空间模型 DA-Mamba

人工智能 2025-09-23 v1

摘要

人类参与度估计在对话场景中至关重要,适用于自适应辅导、远程医疗评估和社交感知的人机交互等应用。参与度是由面部表情、语音、手势和行为线索在时间维度上传递的动态、多模态信号。在本工作中,我们引入了 DA-Mamba,一种面向多模态的对话感知架构,取代注意力密集型对话编码器,使用 Mamba 基于选择的状态空间处理以实现线性时间和内存复杂度,同时保持表现力强的跨模态推理。我们设计了由三个核心模块组成的 Mamba 对话感知选择状态空间模型:对话感知编码器,以及两个 Mamba 基于选择的融合机制:模态组融合和伙伴组融合,这些模块实现了富有表现力的对话理解。在三个标准基准测试(NoXi、NoXi-Add 和 MPIIGI)上的大量实验表明,DA-Mamba 在CCC(concordance correlation coefficient,即一致性相关系数)方面超越了先前的SOTA方法,同时减少了训练时间和峰值内存;这些收益使我们能够处理更长的序列,并在资源受限的多方对话场景中实现实时部署。源代码将在 https://github.com/kksssssss-ssda/MMEA 提供。

关键词

引用

@article{arxiv.2509.17711,
  title  = {DA-Mamba: Dialogue-aware selective state-space model for multimodal engagement estimation},
  author = {Shenwei Kang and Xin Zhang and Wen Liu and Bin Li and Yujie Liu and Bo Gao},
  journal= {arXiv preprint arXiv:2509.17711},
  year   = {2025}
}