探索情感语音与音乐之间的声学相似性:基于自监督表示
音频与语音处理
2025-05-01 v2 人工智能
计算与语言
多媒体
声音
摘要
情感语音与音乐的情感识别因其声学重叠性而产生相似性,这也促使人们对两者之间的知识迁移感兴趣。然而,传统上,由于自监督学习(SSL)模型在语音和音乐领域相对少有跨域应用,语音与音乐之间共享的声学线索,特别是由SSL模型编码的线索,仍然鲜有被探索。本文我们首先分析了用于语音情感识别(SER)和音乐情感识别(MER)的SSL模型在不同层次上的行为,然后通过两阶段微调过程中的多种方法进行跨域适应,探讨了如何有效利用音乐辅助语音情感识别以及如何利用语音辅助音乐情感识别。最后,我们使用Frechet音频距离(Frechet audio distance)针对单个情绪探索情感语音与音乐之间的声学相似性,揭示了语音和音乐SSL模型中存在的情绪偏差问题。我们的发现表明,尽管语音和音乐SSL模型确实捕捉到了共享的声学特征,但其行为会因训练策略和领域特性的不同而在不同情绪下呈现差异。此外,参数高效微调可以通过相互利用知识来提升SER和MER的性能。这一研究为理解情感语音与音乐之间的声学相似性提供了新见解,并凸显了利用跨域泛化来改进SER和MER系统的潜力。
引用
@article{arxiv.2409.17899,
title = {Exploring Acoustic Similarity in Emotional Speech and Music via Self-Supervised Representations},
author = {Yujia Sun and Zeyu Zhao and Korin Richmond and Yuanchao Li},
journal= {arXiv preprint arXiv:2409.17899},
year = {2025}
}
备注
Accepted to ICASSP 2025