语音自监督学习中声道发音的证据
音频与语音处理
2023-07-24 v3 人工智能
声音
摘要
近期的自监督学习 (SSL) 模型已被证明能够学习到丰富的语音表示,可被各类下游任务直接利用。为理解此类效用,已有诸多针对语音 SSL 模型的分析,以揭示所学表示中编码了哪些信息及如何编码。尽管以往分析在声学、音系与语义视角上覆盖面广,但由语音产生带来的物理基础尚未得到充分关注。为弥补此不足,我们开展了一项综合分析,将语音表示与通过电磁发音描记术 (EMA) 测量的发音轨迹相联系。我们的分析基于线性探测方法,其中将发音得分度量定义为对 EMA 的线性映射的平均相关系数。我们分析了一组选自 SUPERB 基准排行榜的 SSL 模型,并对两个最成功的模型 Wav2Vec 2.0 与 HuBERT 做了进一步的逐层分析。令人惊讶的是,近期语音 SSL 模型的表示与 EMA 轨迹高度相关(最佳:r = 0.81),且仅需 5 分钟即可训练出高性能线性模型 (r = 0.77)。我们的发现表明,SSL 模型学习到与连续发音紧密对齐,并为语音 SSL 提供了新的见解。
引用
@article{arxiv.2210.11723,
title = {Evidence of Vocal Tract Articulation in Self-Supervised Learning of Speech},
author = {Cheol Jun Cho and Peter Wu and Abdelrahman Mohamed and Gopala K. Anumanchipalli},
journal= {arXiv preprint arXiv:2210.11723},
year = {2023}
}