基于时长惩罚自监督单元的口语语言建模
计算与语言
2025-05-30 v1 音频与语音处理
摘要
口语语言模型(SLM)通过对自监督语音表示进行离散化来获取声学单元并以此进行操作。尽管这些单元的特性直接影响性能,但码本大小与单元粒度(即时长)之间的相互作用仍未被探索。我们使用简单的时长惩罚动态规划(DPDP)方法,在改变码本大小和单元粒度的情况下研究了 SLM 的性能。在不同的语言学层面进行了新的分析。在音素和词级别,只要码本大小选择得当,粒度带来的益处微乎其微。然而,在重合成任务中生成完整句子时,SLM 使用更粗粒度的单元表现更好。在词汇和句法语言建模任务中,更粗粒度的单元在更低比特率下也能给出更高的准确率。因此我们表明,更粗粒度的单元并不总是更好,但 DPDP 是一种简单高效的方法,可用于在那些有益的任务中获取更粗粒度的单元。
引用
@article{arxiv.2505.23494,
title = {Spoken Language Modeling with Duration-Penalized Self-Supervised Units},
author = {Nicol Visser and Herman Kamper},
journal= {arXiv preprint arXiv:2505.23494},
year = {2025}
}
备注
Accepted to Interspeech 2025