中文

FormalASR:端到端 spoken Chinese to formal text 语种自动语音识别

计算与语言 2026-05-20 v1 人工智能

摘要

自动语音识别(ASR)系统通常针对逐字转录进行优化,这会保留语气不足、填充词以及不正式的口语结构,而这些内容常不适用于面向书写的下游应用。常见的解决办法是采用 ASR+LLM 流水线进行后编辑,但该设计会增加延迟和内存开销,且难以在设备端部署。我们提出 FormalASR,两个规模为 0.6B 和 1.7B 的紧凑型端到端模型,直接将 spoken Chinese 转录为 formal written text。为实现此目标,我们构建了 WenetSpeech-Formal 和 Speechio-Formal 两个大规模 spoken-to-formal 数据集,通过 LLM 基于重写和质量过滤构建。随后我们对 Qwen3-ASR 在两个规模(0.6B 和 1.7B)上进行监督式微调。在 WenetSpeech-Formal 和 Speechio-Formal 上的实验表明,FormalASR 相较于逐字基线实现了最高 37.4% 的相对 CER 降低,同时也提升了 ROUGE-L 和 BERTScore 指标。FormalASR 在部署时无需后处理 LLM,提供了一个轻量级、可部署于设备端的 spoken-to-formal 转录解决方案。

关键词

引用

@article{arxiv.2605.19266,
  title  = {FormalASR: End-to-End Spoken Chinese to Formal Text},
  author = {Wanyi Ning and Yinshang Guo and Haitao Qian and Jiyuan Cheng and Weiyuan Feng and Yufei Zhang},
  journal= {arXiv preprint arXiv:2605.19266},
  year   = {2026}
}