中文

打开 wav2vec 特征编码器的黑箱

声音 2022-10-28 v1 计算与语言 机器学习 音频与语音处理

摘要

自监督模型,即 wav2vec 及其变体,在语音领域的各种下游任务中显示出有希望的结果。然而,它们的内部工作机制尚不清楚,因此需要对模型学习的内容进行深入分析。在本文中,我们专注于卷积特征编码器,其潜在空间通常被推测为表示离散的声学单元。为了以还原的方式分析嵌入空间,我们输入了合成的音频信号,即简单正弦波的总和。通过大量实验,我们得出结论:特征编码器的表示中嵌入了多种信息:(1) 基频,(2) 共振峰,以及 (3) 振幅,并包含了 (4) 足够的时间细节。此外,潜在表示中包含的信息类似于语谱图,但有一个根本区别:潜在表示构建了一个度量空间,使得更接近的表示意味着声学相似性。

关键词

引用

@article{arxiv.2210.15386,
  title  = {Opening the Black Box of wav2vec Feature Encoder},
  author = {Kwanghee Choi and Eun Jung Yeo},
  journal= {arXiv preprint arXiv:2210.15386},
  year   = {2022}
}