UMA-Split:面向英语和中文的非自回归语音识别单模聚合
计算与语言
2025-09-19 v1
摘要
本文提出一种基于单模聚合(UMA)的非自回归模型,用于英语和中文语音识别。原始 UMA 显式地对同一文本标记的声学帧进行分段和聚合(带单模权重,先单调递增后单调递减),以学习比常规连接主义时间分类(CTC)更好的表示。然而,该方法仅在中文中表现良好。在处理其他语言(如英语)时遇到困难,因为单个音节可能被标记为多个细粒度标记,或标记跨越少于 3 个声学帧,无法形成单模权重。为此,我们提出允许每个 UMA 聚合帧映射到多个标记,通过一个简单的分割模块在计算 CTC 损失前从每个聚合帧生成两个标记。
引用
@article{arxiv.2509.14653,
title = {UMA-Split: unimodal aggregation for both English and Mandarin non-autoregressive speech recognition},
author = {Ying Fang and Xiaofei Li},
journal= {arXiv preprint arXiv:2509.14653},
year = {2025}
}
备注
Submit to ICASSP 2026