语音的离散自监督表示能否捕捉声调差异?
计算与语言
2024-10-29 v1 声音
音频与语音处理
摘要
从自监督学习 (SSL) 基础模型获得的语音离散表示被广泛使用,尤其是在下游任务数据有限的情况下,例如低资源语言。通常,将语音离散化为符号序列是通过 SSL 模型隐变量的无监督聚类来实现的。我们的研究评估了使用 k-means 发现的离散符号是否能在两个示例语言(普通话和约鲁巴语)中充分捕捉声调。我们比较了来自 HuBERT base、MandarinHuBERT 或 XLS-R 的隐向量与离散符号在元音和声调分类中的表现。我们发现,使用离散符号会导致声调信息的大量丢失,即使对于针对特定语言的 SSL 模型也是如此。我们建议离散化需要具备任务感知能力,特别是对于依赖声调的下游任务。
引用
@article{arxiv.2410.19935,
title = {Do Discrete Self-Supervised Representations of Speech Capture Tone Distinctions?},
author = {Opeyemi Osakuade and Simon King},
journal= {arXiv preprint arXiv:2410.19935},
year = {2024}
}
备注
Submitted to ICASSP 2025