PARROT:通过并行分支 Hadamard 最优传输协同 Mamba 与基于注意力的 SSL 预训练模型以用于语音情感识别
音频与语音处理
2025-06-03 v1 声音
摘要
Mamba 作为基于注意力架构的替代方案出现,推动了用于语音和音频处理的基于 Mamba 的自监督学习 (SSL) 预训练模型 (PTM) 的发展。最近的研究表明,对于语音情感识别 (SER),这些模型实现了与最先进的 (SOTA) 基于注意力的 PTM 相当或更优的性能。受先前展示跨不同语音处理任务的 PTM 融合优势的工作启发,我们假设利用基于 Mamba 和基于注意力的 PTM 的互补优势,将超越同质基于注意力的 PTM 的融合,从而提升 SER 性能。为此,我们引入了一种新颖的框架 PARROT,该框架将并行分支融合与最优传输和 Hadamard 乘积相结合。我们的方法相对于单个 PTM、同质 PTM 融合以及基线融合技术取得了 SOTA 结果,从而突显了异构 PTM 融合在 SER 中的潜力。
引用
@article{arxiv.2506.01138,
title = {PARROT: Synergizing Mamba and Attention-based SSL Pre-Trained Models via Parallel Branch Hadamard Optimal Transport for Speech Emotion Recognition},
author = {Orchid Chetia Phukan and Mohd Mujtaba Akhtar and Girish and Swarup Ranjan Behera and Jaya Sai Kiran Patibandla and Arun Balaji Buduru and Rajesh Sharma},
journal= {arXiv preprint arXiv:2506.01138},
year = {2025}
}
备注
Accepted to INTERSPEECH 2025