基于无对齐训练的 transducer 多说话者语音识别
音频与语音处理
2024-10-01 v1 计算与语言
声音
摘要
将 RNN Transducer (RNNT) 扩展到识别多说话者语音是实现更广泛语音识别 (ASR) 应用的必然之路。多说话者 RNNT (MT-RNNT) 旨在实现无需昂贵前端源分离的识别。MT-RNNT 通常通过多路编码器或解码器结构实现,或将所有说话者的转录序列化到单个输出流中。第一种方法计算成本高昂,尤其需要多个编码器处理。相比之下,第二种方法涉及复杂的标签生成过程,需要来自外部 ASR 系统准确获取的所有说话者所有单词的时间戳。本文提出一种 novel 的无对齐训练方案用于 MT-RNNT (MT-RNNT-AFT),采用标准 RNNT 架构。目标标签通过在每个说话者的转录开头添加对应的提示 token 来创建,反映每个说话者在混合信号中出现的顺序。因此,MT-RNNT-AFT 可以在不依赖准确对齐的情况下进行训练,只需一次编码器处理即可识别所有说话者的语音。实验表明,MT-RNNT-AFT 的性能媲美最新方法,同时大大简化了训练过程。
引用
@article{arxiv.2409.20301,
title = {Alignment-Free Training for Transducer-based Multi-Talker ASR},
author = {Takafumi Moriya and Shota Horiguchi and Marc Delcroix and Ryo Masumura and Takanori Ashihara and Hiroshi Sato and Kohei Matsuura and Masato Mimura},
journal= {arXiv preprint arXiv:2409.20301},
year = {2024}
}
备注
Submitted to ICASSP 2025