自监督语音模型探究:一项基于情感语料库的研究
音频与语音处理
2022-12-13 v3 计算与语言
声音
摘要
自监督语音模型在过去几年中快速发展,并已被证明可用于各种下游任务。一些近期工作已开始关注这些模型的特征,但许多问题尚未完全解决。在本工作中,我们对情感语料库进行研究以探究一个流行的自监督模型——wav2vec 2.0。通过一组定量分析,我们主要证明:1) wav2vec 2.0 似乎丢弃了对话语识别用途较小的副语言信息;2) 对于情感识别,仅来自中间层的表示表现与层平均得到的表示相当,而最终层在某些情况下导致最差性能;3) 当前的自监督模型可能并非利用非词汇特征的下游任务的最优解。我们的工作提供了新颖发现,将有助于该领域的未来研究并为现有模型的使用提供理论基础。
引用
@article{arxiv.2210.02595,
title = {Exploration of A Self-Supervised Speech Model: A Study on Emotional Corpora},
author = {Yuanchao Li and Yumnah Mohamied and Peter Bell and Catherine Lai},
journal= {arXiv preprint arXiv:2210.02595},
year = {2022}
}
备注
Accepted to SLT 2022