中文

用于逆文本规范化的动态上下文感知流式预训练语言模型

计算与语言 2025-06-02 v1 声音 音频与语音处理

摘要

逆文本规范化 (ITN) 对于将口语化的自动语音识别 (ASR) 输出转换为格式良好的书面文本至关重要,可提升可读性与可用性。尽管其十分重要,但由于准确性、效率和适应性方面的挑战,特别是在低资源和有限上下文场景中,将流式 ITN 集成到流式 ASR 中在很大程度上仍未被探索。在本文中,我们引入了一种用于 ITN 的流式预训练语言模型,利用预训练的语言表示来提高鲁棒性。为应对流式约束,我们在训练和推理阶段提出动态上下文感知,实现自适应块大小调整并整合右上下文信息。实验结果表明,我们的方法在越南语数据集上实现了与非流式 ITN 相当的准确率,并超越了现有的流式 ITN 模型,同时保持低延迟,确保了与 ASR 系统的无缝集成。

关键词

引用

@article{arxiv.2505.24229,
  title  = {Dynamic Context-Aware Streaming Pretrained Language Model For Inverse Text Normalization},
  author = {Luong Ho and Khanh Le and Vinh Pham and Bao Nguyen and Tan Tran and Duc Chau},
  journal= {arXiv preprint arXiv:2505.24229},
  year   = {2025}
}

备注

Accepted to INTERSPEECH 2025