单兵强劲,协同更强:协同模态绑定基础模型与最优传输用于非言语情感识别
音频与语音处理
2024-09-24 v1 声音
摘要
在本研究中,我们研究了用于从非言语声音中识别情感的多模态基础模型(MFMs)。我们假设,MFMs 由于在多种模态上进行了联合预训练,能够更好地解释和区分在仅音频基础模型(AFMs)中可能显得模糊的细微情感线索,从而在非言语声音情感识别(NVER)中更为有效。为了验证我们的假设,我们从 SOTA 的 MFMs 和 AFMs 中提取表示,并在基准 NVER 数据集上对它们进行评估。受语音识别和音频深度伪造检测研究的启发,我们还研究了结合精选基础模型表示以进一步增强 NVER 的潜力。为此,我们提出了一个名为 MATA(通过传输注意力进行模态内对齐)的框架。通过 MATA 以及 MFMs(LanguageBind 和 ImageBind)的结合,我们在 ASVP-ESD、JNV 和 VIVAE 数据集上取得了最高性能,准确率分别为 76.47%、77.40%、75.12%,F1 分数分别为 70.35%、76.19%、74.63%,优于单个 FM 和基线融合技术,并在这些基准数据集上达到了 SOTA。
引用
@article{arxiv.2409.14221,
title = {Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition},
author = {Orchid Chetia Phukan and Mohd Mujtaba Akhtar and Girish and Swarup Ranjan Behera and Sishir Kalita and Arun Balaji Buduru and Rajesh Sharma and S. R Mahadeva Prasanna},
journal= {arXiv preprint arXiv:2409.14221},
year = {2024}
}
备注
Submitted to ICASSP 2025