中文

语音表示学习再探:独立可学习参数与鲁棒数据增强的必要性

计算与语言 2025-03-04 v2

摘要

语音建模方法为固定语音片段(通常为 10-25 毫秒)学习一个嵌入。语音中的信息可分为两类:"说了什么"(内容)和"如何表达"(其他),两者在本质上正交,若强制联合优化会导致优化算法找到次优解。这导致在下游任务中一项或全部任务表现不佳,如先前研究所表明的。当前的自监督学习(SSL)方法(如 HuBERT)非常擅长建模语音中的内容信息。数据增强提升了需要有效建模其他信息的任务性能,但这会导致模型容量的分裂。在本工作中,我们进行了一项初步研究,以理解使用独立可学习参数建模其他信息的重要性。我们提出了一种 HuBERT 的改进版本,称为 Other HuBERT(O-HuBERT),以验证我们的假设。我们的发现有两方面:第一,O-HuBERT 方法能够利用所有层构建复杂特征以编码其他信息;第二,鲁棒的数据增强策略对于学习依赖其他信息的任务所需信息以及在使用规模相当的模型(1 亿参数)和预训练数据(960 小时)的情况下实现 SUPERB 基准上的最先进(SOTA)性能至关重要。

关键词

引用

@article{arxiv.2408.10557,
  title  = {Speech Representation Learning Revisited: The Necessity of Separate Learnable Parameters and Robust Data Augmentation},
  author = {Hemant Yadav and Sunayana Sitaram and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2408.10557},
  year   = {2025}
}