词汇声调难以量化:探究普通话和约鲁巴语中的离散语音单元
计算与语言
2026-04-10 v1 机器学习
摘要
离散语音单元(DSU)是通过量化使用自监督学习(SSL)训练的模型表示而得到的。它们是各种口语语言任务的流行表示,包括那些韵律重要的任务。DSU对于文本和语音联合建模的任务特别方便,例如文本到语音和多模态对话系统。但我们发现,DSU编码超音段信息的可靠性低于音段结构,我们在本工作中使用词汇声调证明了这一点,尽管这个限制可能扩展到其他超音段特征,如韵律。我们使用声调语言普通话和约鲁巴语的调查表明,SSL潜在表示本身确实编码了声调,然而使用量化获得的DSU倾向于优先考虑语音结构,这使得词汇声调的编码可靠性降低。对于各种量化方法,而不仅仅是最常见的K-means,情况依然如此。我们得出结论,当前的DSU量化策略对于超音段特征存在局限性,这表明在语音表示学习中需要新的、对声调敏感(或对韵律敏感)的技术。我们通过先执行一次K-means聚类来编码语音信息,然后在残差表示上再次执行K-means聚类,从而指出了解决方案的一种潜在形式,这种方法能更好地编码词汇声调。
引用
@article{arxiv.2604.07467,
title = {Lexical Tone is Hard to Quantize: Probing Discrete Speech Units in Mandarin and Yor\`ub\'a},
author = {Opeyemi Osakuade and Simon King},
journal= {arXiv preprint arXiv:2604.07467},
year = {2026}
}
备注
Accepted at Speech Prosody 2026