中文

更大并不总是更好:上下文大小对语音预训练的影响

计算与语言 2024-10-28 v1 声音 音频与语音处理

摘要

在自动语音识别(ASR)文献中,通常假设模型能够访问更宽的上下文窗口会更好。然而,在监督学习环境中这可能成立的许多潜在原因,并不一定适用于无监督学习的情况。我们研究了使用自监督学习实现高质量预训练声学模型需要多少上下文。我们主要研究了对比预测编码(CPC),并对其进行了调整,以便能够精确控制训练和推理期间模型可见的上下文量。我们发现,所得模型表示中的音素可区分性在约 40~ms 的前序上下文处达到峰值,并且过多的上下文(超过约 320 ms)会大幅降低表示的质量。令人惊讶的是,我们发现当预训练表示被用作冻结的输入特征时,这种模式也适用于监督 ASR。我们的结果指出了当前上游架构设计中潜在的改进方向,以更好地促进各种下游任务。

关键词

引用

@article{arxiv.2312.01515,
  title  = {Bigger is not Always Better: The Effect of Context Size on Speech Pre-Training},
  author = {Sean Robertson and Ewan Dunbar},
  journal= {arXiv preprint arXiv:2312.01515},
  year   = {2024}
}

备注

Repository at https://github.com/sdrobert/scpc. This work has been submitted to the IEEE for possible publication