探索多语言未见说话人情感识别:利用协注意力 cues 在多任务学习中的应用
计算与语言
2024-06-21 v2 人工智能
声音
音频与语音处理
摘要
现代深度学习技术的出现催生了语音情感识别(SER)领域的诸多进展。然而,大多数系统在泛化到训练期未见的说话人方面存在挑战。本研究聚焦于处理多语言SER中的未见说话人问题。我们引入CAMuLeNet,这是一种新型架构,利用基于协注意力的融合和多任务学习以解决此问题。此外,我们在五个现有多语言基准数据集上使用10折留说话人交叉验证,对比评估了Whisper、HuBERT、Wav2Vec2.0和WavLM等预训练编码器的性能,并发布了一个用于情感识别的印地语数据集(BhavVani)。CAMuLeNet在所有基准测试中关于未见说话人的平均性能提升约为8%。
引用
@article{arxiv.2406.08931,
title = {Exploring Multilingual Unseen Speaker Emotion Recognition: Leveraging Co-Attention Cues in Multitask Learning},
author = {Arnav Goel and Medha Hira and Anubha Gupta},
journal= {arXiv preprint arXiv:2406.08931},
year = {2024}
}
备注
5 pages, Accepted to INTERSPEECH 2024. The first two authors contributed equally