Speaker-Distinguishable CTC:用于多说人语音识别的说话人区分学习
音频与语音处理
2025-06-10 v1 计算与语言
声音
摘要
本文提出了一种 novel 框架,用于无需额外信息进行多说人语音识别。序列化输出训练(SOT)这种广泛使用的方法由于说话人分配失败而存在识别错误。虽然 incorporating 额外信息(如标记级时间戳)可以提高识别准确率,但从自然对话语音中提取此类信息仍然具有挑战性。为解决这一局限性,我们提出了Speaker-Distinguishable CTC(SD-CTC),这是一种将每个帧与其对应的说话人标签一起分配的CTC扩展。我们进一步将SD-CTC集成到SOT框架中,使SOT模型仅能使用重叠语音和转录文本学习说话人区分。实验比较表明,结合SD-CTC和SOT的多任务学习可减少SOT模型的错误率26%,并实现与依赖额外信息的state-of-the-art方法相当的性能。
引用
@article{arxiv.2506.07515,
title = {Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition},
author = {Asahi Sakuma and Hiroaki Sato and Ryuga Sugano and Tadashi Kumano and Yoshihiko Kawai and Tetsuji Ogawa},
journal= {arXiv preprint arXiv:2506.07515},
year = {2025}
}
备注
Accepted at INTERSPEECH 2025