分段可变码本:用于保存语气和韵律信息的分割变体码本
音频与语音处理
2025-05-22 v1 计算与语言
声音
摘要
SSL 语音模型中的量化(如 HuBERT)可改善压缩和语言建模、语音合成和文本转语音等任务的性能,但常常会丢弃语气和语音增强信息(如情绪、突出性)。虽然增加码本大小可缓解部分损失,但效率低下地提高比特率。我们提出分段可变码本(SVC),在不同语言单位(帧、音、词、句)上对语音进行量化,将其分解为多个分段特定离散特征流。我们的实验表明,SVC 在探针任务中更有效地保留语气和语音增强信息。此外,我们发现,在离散化之前进行池化比在离散化之后进行池化更能保留分段级别的信息。重建实验进一步确认,风格实现得到改善,同时保持可理解性。
引用
@article{arxiv.2505.15667,
title = {Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information},
author = {Nicholas Sanders and Yuanchao Li and Korin Richmond and Simon King},
journal= {arXiv preprint arXiv:2505.15667},
year = {2025}
}
备注
Accepted to Interspeech 2025