基于变分预测编码的语音表征学习
音频与语音处理
2026-01-05 v1 计算与语言
摘要
尽管 HuBERT 目标函数是学习语音表征的最著名目标,但其并未得到进一步的开发与改进。我们认为,缺乏一种底层原理导致了其发展停滞。本文中,我们展示了在变分视角下进行的预测编码是 HuBERT 目标函数背后的原理。由于其普遍性,我们的表述为改进参数化和优化提供了机会,我们展示了两种简单的修改,能够立即改善 HuBERT 目标函数。此外,预测编码表述与各种其他目标函数之间有紧密联系,如 APC、CPC、wav2vec 和 BEST-RQ。经实验验证,预训练方面的改进带来了对四个下游任务的显著提升:手机分类、基频追踪、说话人识别和自动语音识别,凸显了预测编码解释的重要性。
引用
@article{arxiv.2601.00100,
title = {Learning Speech Representations with Variational Predictive Coding},
author = {Sung-Lin Yeh and Peter Bell and Hao Tang},
journal= {arXiv preprint arXiv:2601.00100},
year = {2026}
}
备注
Accepted to Transactions of the Association for Computational Linguistics (TACL); Pre MIT Press version