Echotune:一种在 ASR 任务中利用语音变长特性的模块化提取器
声音
2024-04-09 v2 计算与语言
音频与语音处理
摘要
Transformer 架构已被证明对自动语音识别(ASR)任务极为有效,成为该领域大量研究的基础组件。历史上许多方法依赖固定长度注意力窗口,这对时长与复杂度各异的语音样本会产生问题,导致数据过平滑并忽略必要的长程连接。针对该局限,我们提出 Echo-MSA,一种配备变长注意力机制的轻量模块,可适应不同复杂度和时长的语音样本。该模块能灵活提取从帧、音素到词与语篇等多粒度的语音特征。所提设计捕捉了语音的变长特性并解决了固定长度注意力的局限。我们的评测采用并行注意力架构,并辅以动态门控机制,将传统注意力与 Echo-MSA 模块输出相融合。实验证据表明,将 Echo-MSA 纳入主模型训练显著改善了词错误率(WER)表现,同时保持原模型内在稳定性。
引用
@article{arxiv.2309.07765,
title = {Echotune: A Modular Extractor Leveraging the Variable-Length Nature of Speech in ASR Tasks},
author = {Sizhou Chen and Songyang Gao and Sen Fang},
journal= {arXiv preprint arXiv:2309.07765},
year = {2024}
}