语音自监督离散表示的信息论分析
计算与语言
2023-06-06 v1
摘要
语音的自监督表示学习常涉及将声学输入转换为离散单元的量化步骤。然而,如何刻画这些离散单元与音素等抽象语音类别之间的关系仍不清楚。本文发展了一个信息论框架,将每个语音类别表示为离散单元上的分布。我们将该框架应用于两种不同自监督模型(即 wav2vec 2.0 与 XLSR),并以美国英语语音为案例研究。我们的研究表明,语音分布的熵反映了底层语音的可变性,语音相似的声音呈现相似分布。尽管我们的研究证实了缺乏直接的一一对应,我们发现语音类别与离散单元之间存在一种有趣的间接关系。
引用
@article{arxiv.2306.02405,
title = {An Information-Theoretic Analysis of Self-supervised Discrete Representations of Speech},
author = {Badr M. Abdullah and Mohammed Maqsood Shaik and Bernd Möbius and Dietrich Klakow},
journal= {arXiv preprint arXiv:2306.02405},
year = {2023}
}
备注
Accepted in Interspeech 2023