自监督模型在韵律相关任务中的效用研究
计算与语言
2022-10-27 v2 音频与语音处理
摘要
基于语音数据的自监督学习(SSL)所生成的模型在许多任务中取得了卓越性能,并且已知其隐式地表示了语音信号中潜在存在的多方面信息。然而,关于此类模型对韵律相关任务的适用性以及它们在多大程度上编码了韵律信息,人们知之甚少。我们提出了一个新的评估框架 SUPERB-prosody,包含三个韵律相关的下游任务和两个伪任务。我们发现 15 个 SSL 模型中有 13 个在所有韵律相关任务上均优于基线。我们还展示了在两个伪任务上的良好表现:韵律重建与未来韵律预测。我们进一步分析了 SSL 模型的逐层贡献。总体而言,我们得出结论:SSL 语音模型对韵律相关任务极为有效。
引用
@article{arxiv.2210.07185,
title = {On the Utility of Self-supervised Models for Prosody-related Tasks},
author = {Guan-Ting Lin and Chi-Luen Feng and Wei-Ping Huang and Yuan Tseng and Tzu-Han Lin and Chen-An Li and Hung-yi Lee and Nigel G. Ward},
journal= {arXiv preprint arXiv:2210.07185},
year = {2022}
}
备注
Accepted to IEEE SLT 2022