多分辨率语音自监督学习的实证分析
音频与语音处理
2024-11-01 v1 机器学习
摘要
自监督学习(Self-supervised learning, SSL)模型在语音处理中已变得至关重要,近期的进展集中在开发能够捕获多时间尺度表示的架构上。这些多尺度架构的主要目标是利用语音的层次性,其中低分辨率组件旨在捕获与日益抽象的概念(例如,从音素到单词再到句子)对齐的表示。尽管多尺度方法相比单尺度模型已显示出一些改进,但这些增强的确切原因缺乏实证支持。在本研究中,我们对多尺度架构中的逐层表示进行了初步分析,重点关注典型相关分析(Canonical Correlation Analysis, CCA)和互信息(Mutual Information, MI)。我们将此分析应用于多分辨率HuBERT(MR-HuBERT),发现:(1) 在SUPERB任务上性能的提升主要归因于辅助的低分辨率损失,而非下采样本身;(2) 下采样到更低分辨率既不能提高下游性能,也不与更高层次的信息(例如单词)相关,尽管它确实提高了计算效率。这些发现挑战了关于MR-HuBERT多尺度性质的假设,并强调了将计算效率与学习更好表示解耦的重要性。
引用
@article{arxiv.2410.23955,
title = {An Empirical Analysis of Speech Self-Supervised Learning at Multiple Resolutions},
author = {Theo Clark and Benedetta Cevoli and Eloy de Jong and Timofey Abramski and Jamie Dougherty},
journal= {arXiv preprint arXiv:2410.23955},
year = {2024}
}