超长语境语音识别的实证研究
音频与语音处理
2026-02-11 v1 声音
摘要
自动语音识别(ASR)模型通常在单个 utterance 上进行训练,时长不足 30 秒。这一选择部分是由于计算限制,但也反映了一种常见的、但往往不准确的建模假设,即将 utterance 视为独立同分布样本。当面对长格式音频录音时,这些系统必须首先将录音分割为短小的 utterance 并独立处理。本文指出,由于近期的算法和硬件进步,这一做法已不再必要,当前的注意力机制方法可用于训练 operate on 超过 1 小时长度的序列的 ASR 系统。因此,为更好地理解训练/评估序列长度与性能之间的关系,我们使用 10 种不同的序列长度(从 10 秒到 1 小时)在大规模数据上训练 ASR 模型。结果表明,使用最长达 21.8 分钟的上下文可带来收益,相较于短上下文基线可实现最高 14.2% 的相对改进。通过修改各种架构组件,我们发现编码位置信息的方法以及模型的宽度和深度是处理长序列的重要因素。最后,构建了一系列用于分析模型使用上下文的合成数据评估。从这些结果可以看出,模型正在使用来自遥远上下文的语言和声学特征。
引用
@article{arxiv.2602.09044,
title = {Beyond the Utterance: An Empirical Study of Very Long Context Speech Recognition},
author = {Robert Flynn and Anton Ragni},
journal= {arXiv preprint arXiv:2602.09044},
year = {2026}
}
备注
Accepted to IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP), 2026. doi: 10.1109/TASLPRO.2026.3658246