基于俄语音素语料库揭示 HubertSoft 嵌入的隐藏时序结构
声音
2025-07-10 v1 音频与语音处理
摘要
自监督学习 (SSL) 模型如 Wav2Vec 2.0 和 HuBERT 在从原始音频中提取音素信息方面显示出惊人的成功。尽管已有工作表明 SSL 嵌入在帧层级上编码音素特征,但这些模型是否保留时序结构,特别是嵌入在音素边界处是否反映相邻音素的身份与顺序,仍不清楚。本研究探讨了 HubertSoft——一种 HuBERT 的软聚类变体——边界敏感嵌入是否编码音素过渡。我们使用 CORPRES 俄语语音语料库,将 20 ms 的嵌入窗口标记为对应其开始、中心和末端片段的音素三元组。分别训练神经网络预测这些位置,并使用多种评估指标(如有序准确率、无序准确率和灵活的中心准确率)评估时序敏感性。结果表明,位于音素边界处提取的嵌入捕获了音素身份和时序顺序,尤其在片段边界处准确率很高。混淆模式进一步表明,该模型编码了语音细节和共同话音效应。这些发现有助于我们更好地理解 SSL 语音表示的内部结构及其在音素学分析和精细转录任务中的潜在应用。
引用
@article{arxiv.2507.06794,
title = {Revealing the Hidden Temporal Structure of HubertSoft Embeddings based on the Russian Phonetic Corpus},
author = {Anastasia Ananeva and Anton Tomilov and Marina Volkova},
journal= {arXiv preprint arXiv:2507.06794},
year = {2025}
}
备注
11 pages, 5 figures, Specom 2025 conference