中文

语音自监督学习中声道发音的证据

音频与语音处理 2023-07-24 v3 人工智能 声音

摘要

近期的自监督学习 (SSL) 模型已被证明能够学习到丰富的语音表示,可被各类下游任务直接利用。为理解此类效用,已有诸多针对语音 SSL 模型的分析,以揭示所学表示中编码了哪些信息及如何编码。尽管以往分析在声学、音系与语义视角上覆盖面广,但由语音产生带来的物理基础尚未得到充分关注。为弥补此不足,我们开展了一项综合分析,将语音表示与通过电磁发音描记术 (EMA) 测量的发音轨迹相联系。我们的分析基于线性探测方法,其中将发音得分度量定义为对 EMA 的线性映射的平均相关系数。我们分析了一组选自 SUPERB 基准排行榜的 SSL 模型,并对两个最成功的模型 Wav2Vec 2.0 与 HuBERT 做了进一步的逐层分析。令人惊讶的是,近期语音 SSL 模型的表示与 EMA 轨迹高度相关(最佳:r = 0.81),且仅需 5 分钟即可训练出高性能线性模型 (r = 0.77)。我们的发现表明,SSL 模型学习到与连续发音紧密对齐,并为语音 SSL 提供了新的见解。

关键词

引用

@article{arxiv.2210.11723,
  title  = {Evidence of Vocal Tract Articulation in Self-Supervised Learning of Speech},
  author = {Cheol Jun Cho and Peter Wu and Abdelrahman Mohamed and Gopala K. Anumanchipalli},
  journal= {arXiv preprint arXiv:2210.11723},
  year   = {2023}
}