中文

单兵强劲,协同更强:协同模态绑定基础模型与最优传输用于非言语情感识别

音频与语音处理 2024-09-24 v1 声音

摘要

在本研究中,我们研究了用于从非言语声音中识别情感的多模态基础模型(MFMs)。我们假设,MFMs 由于在多种模态上进行了联合预训练,能够更好地解释和区分在仅音频基础模型(AFMs)中可能显得模糊的细微情感线索,从而在非言语声音情感识别(NVER)中更为有效。为了验证我们的假设,我们从 SOTA 的 MFMs 和 AFMs 中提取表示,并在基准 NVER 数据集上对它们进行评估。受语音识别和音频深度伪造检测研究的启发,我们还研究了结合精选基础模型表示以进一步增强 NVER 的潜力。为此,我们提出了一个名为 MATA(通过传输注意力进行模态内对齐)的框架。通过 MATA 以及 MFMs(LanguageBind 和 ImageBind)的结合,我们在 ASVP-ESD、JNV 和 VIVAE 数据集上取得了最高性能,准确率分别为 76.47%、77.40%、75.12%,F1 分数分别为 70.35%、76.19%、74.63%,优于单个 FM 和基线融合技术,并在这些基准数据集上达到了 SOTA。

关键词

引用

@article{arxiv.2409.14221,
  title  = {Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition},
  author = {Orchid Chetia Phukan and Mohd Mujtaba Akhtar and Girish and Swarup Ranjan Behera and Sishir Kalita and Arun Balaji Buduru and Rajesh Sharma and S. R Mahadeva Prasanna},
  journal= {arXiv preprint arXiv:2409.14221},
  year   = {2024}
}

备注

Submitted to ICASSP 2025