我的基于注意力的ASR系统需要多少上下文?
计算与语言
2024-06-18 v2 声音
音频与语音处理
摘要
对于语音识别任务,在训练期间使用超过30秒的声学上下文在文献中不常见且研究不足。在本工作中,我们对用于训练/评估(基于稠密注意力的)声学模型的序列长度缩放对语音识别性能的影响进行了实证研究。这些实验使用了约100,000个伪标注的Spotify播客数据集,探索了从5秒到1小时的上下文长度。在长格式数据集Earnings-22、Tedlium和Rev16上给出了零样本评估。结果显示使用长达21.8分钟的声学上下文进行训练有益,相较使用10秒上下文训练的基线显示出最高14.5%的相对提升。我们发现模型的宽度/深度、位置编码方案以及注意力头数量影响其利用更长上下文的能力。
引用
@article{arxiv.2310.15672,
title = {How Much Context Does My Attention-Based ASR System Need?},
author = {Robert Flynn and Anton Ragni},
journal= {arXiv preprint arXiv:2310.15672},
year = {2024}
}
备注
Accepted at Interspeech 2024