用更少资源学习更多:面向低资源语音情感识别的自监督方法
声音
2025-06-04 v1 计算与语言
摘要
语音情感识别(SER)在深度学习的推动下取得了显著进展,但由于标注数据的稀缺,在低资源语言(LRL)中仍面临挑战。在本工作中,我们探索无监督学习以改善低资源环境下的 SER。具体而言,我们研究了对比学习(CL)和 Bootstrap Your Own Latent(BYOL)作为自监督方法来增强跨语言泛化能力。我们的方法在 Urdu 语上取得了 10.6% 的 F1 分数提升,在 German 语上提升了 15.2%,在 Bangla 语上提升了 13.9%,证明了它们在 LRL 中的有效性。此外,我们分析了模型行为,以提供关于影响跨语言性能关键因素的见解,并突出了低资源 SER 中的挑战。这项工作为开发面向代表性不足语言的更具包容性、可解释性和鲁棒性的情感识别系统奠定了基础。
引用
@article{arxiv.2506.02059,
title = {Learning More with Less: Self-Supervised Approaches for Low-Resource Speech Emotion Recognition},
author = {Ziwei Gong and Pengyuan Shi and Kaan Donbekci and Lin Ai and Run Chen and David Sasu and Zehui Wu and Julia Hirschberg},
journal= {arXiv preprint arXiv:2506.02059},
year = {2025}
}
备注
Accepted at Interspeech 2025