中文

JSPG:基于联合语义-拼音-字形检索的中文情境语音识别动态词典过滤

计算与语言 2026-05-19 v1

摘要

情境语音识别(ASR)面临大规模关键词词典带来的挑战,因过多无关候选会引入噪声而降低准确率。为此,动态过滤通常使用基础 ASR 模型生成初步假设,再通过语义文本检索器获取相关关键词的精简子集。然而,这种方法在中文 ASR 中常常失败。基础模型会产生同音或近同音错误,这些错误保留了目标关键词的语音线索,但严重扭曲其语义含义,导致标准语义检索器失效。为解决此问题,我们提出一种集成语义、拼音、字形特征(JSPG)的过滤框架。拼音有效地基于相似度检索目标,而字形提供补充的结构线索,用于过滤中文固有的大量同音字。为弥合字符级拼音/字形度量与序列级过滤之间的鸿沟,我们引入扩展 Smith-Waterman 算法,用于计算 N-best 假设序列与关键词之间的相似度得分。实验在 Aishell-1 和 RWCS-NER 数据集上表明,JSPG 显著优于单特征基线方法。此外,由 JSPG 引导的下游情境 ASR 模型在关键词识别准确率上实现了显著提升。

关键词

引用

@article{arxiv.2605.16896,
  title  = {JSPG: Dynamic Dictionary Filtering via Joint Semantic-Pinyin-Glyph Retrieval for Chinese Contextual ASR},
  author = {Shilin Zhou and Zhenghua Li},
  journal= {arXiv preprint arXiv:2605.16896},
  year   = {2026}
}