中文

情境收益-22:野外带自定义词汇的语音识别基准

计算与语言 2026-04-10 v1 人工智能 声音

摘要

语音识别系统的准确率前沿在学术基准测试中已趋于饱和。相比之下,工业基准和高风险领域的应用显示效果仍在提升。我们假设两者的主要区别在于情境条件:学术基准以频繁出现的通用词汇为主,这些词汇相对容易识别,而自定义词汇则稀有且情境特定,对语音转录的可用性具有决定性影响。尽管在情境语音识别方面取得了进展,但尚无标准化基准。我们引入情境收益-22,基于收益-22构建的开放数据集,包含真实世界的自定义词汇情境,以促进研究并揭示潜在进展。我们为两种主流方法(关键词提示和关键词提升)建立了六个强基准。实验表明,两种方法在从概念验证扩展到大规模系统时都能实现可比且显著提高的准确率。

关键词

引用

@article{arxiv.2604.07354,
  title  = {Contextual Earnings-22: A Speech Recognition Benchmark with Custom Vocabulary in the Wild},
  author = {Berkin Durmus and Chen Cen and Eduardo Pacheco and Arda Okan and Atila Orhon},
  journal= {arXiv preprint arXiv:2604.07354},
  year   = {2026}
}