面向自动语音识别的数据高效在-policy 蒸馏
人工智能
2026-05-28 v1
摘要
构建具竞争力的自动语音识别(ASR)模型通常需要大规模音频监督,这会导致复现和专业化成本高昂。我们研究了一个 0.6B 参数的音频条件语言模型(Ark-ASR),其使用 100k 小时的语音进行训练,并检验了强大的 Qwen-ASR 教师是否可以通过在-policy 蒸馈将额外的识别能力传递给学生。跨越普通话和英语 ASR 基准测试,提出的训练配方在监督微调之外持续改进,并在四个五个评估集中均优于同规模的 Qwen3-ASR-0.6B 基线。这一成果仅使用 100k 小时的语音,即可实现,而 Qwen3-Omni AuT 编码器报告的监督音频则为 20M 小时。更大的 Qwen3-ASR-1.7B 仍然更强大,但结果表明,教师引导的在-policy 训练在更小的音频预算下,为紧凑型 ASR 模型显著缩小了与更大模型之间的差距。一种支持-覆盖诊断进一步表明,教师-数据阶段改善了局部学生-教师兼容性,这与最近分析何时有效进行在-policy 蒸馈相吻合。
引用
@article{arxiv.2605.28139,
title = {Data-Efficient On-Policy Distillation for Automatic Speech Recognition},
author = {Yu Lin and Yiming Wang and Runyuan Cai and Xiaodong Zeng},
journal= {arXiv preprint arXiv:2605.28139},
year = {2026}
}