离散单元对于语音语言建模是否必要?
计算与语言
2022-11-23 v2 机器学习
摘要
近期语音语言建模的研究表明,可在无任何文本标签的情况下从原始音频中无监督地学习语言。该方法首先依赖将音频转换为离散单元(或伪文本)序列,然后直接在此类伪文本上训练语言模型。这种离散瓶颈是否必要——它可能给语音信号编码引入不可逆错误——抑或我们根本无需离散单元也能学习语言模型?本文中,我们研究离散与连续表示在语音语言建模中的作用。我们表明离散化确为语音语言建模良好结果所必需。我们证明离散化从连续特征中去除了语言无关信息,有助于提升语言建模性能。基于此研究,我们在HuBERT特征的离散单元上训练语言模型,在零资源语音挑战2021(赛道1——仅语音)的词汇、句法与语义指标上达到新的最先进(SOTA)结果。
引用
@article{arxiv.2203.05936,
title = {Are discrete units necessary for Spoken Language Modeling?},
author = {Tu Anh Nguyen and Benoit Sagot and Emmanuel Dupoux},
journal= {arXiv preprint arXiv:2203.05936},
year = {2022}
}