Typhoon ASR Real-time:用于泰语自动语音识别的 FastConformer-Transducer
计算与语言
2026-01-21 v1
摘要
诸如 Whisper 之类的大型编码器-解码器模型实现了强大的离线转录,但由于高延迟,在流式应用中仍不切实际。然而,由于预训练检查点的易获取性,开放的泰语 ASR 领域仍由这些离线架构主导,在高效的流式解决方案方面留下了关键空白。我们提出了 Typhoon ASR Real-time,一个用于低延迟泰语语音识别的 1.15 亿参数 FastConformer-Transducer 模型。我们证明,严格的文本归一化可以匹敌模型缩放的影响:与 Whisper Large-v3 相比,我们的紧凑模型在提供相当准确率的同时,计算成本降低了 45 倍。我们的归一化流水线解决了泰语转录中的系统性歧义——包括上下文相关的数字口语化和重复标记符——从而创建了一致的训练目标。我们进一步引入了一种用于伊善(东北部)方言适应的两阶段课程学习方法,该方法保留了中部泰语的性能。为了解决泰语 ASR 中的可复现性挑战,我们发布了 Typhoon ASR Benchmark,这是一个遵循既定泰语语言学惯例转录的金标准人工标注数据集,为研究社区提供了标准化的评估协议。
引用
@article{arxiv.2601.13044,
title = {Typhoon ASR Real-time: FastConformer-Transducer for Thai Automatic Speech Recognition},
author = {Warit Sirichotedumrong and Adisai Na-Thalang and Potsawee Manakul and Pittawat Taveekitworachai and Sittipong Sripaisarnmongkol and Kunat Pipatanakul},
journal= {arXiv preprint arXiv:2601.13044},
year = {2026}
}
备注
Models and datasets are publicly available on https://huggingface.co/collections/typhoon-ai/typhoon-asr-technical-report ; Project Page: https://opentyphoon.ai/model/typhoon-asr-realtime