中文

Speaker-Distinguishable CTC:用于多说人语音识别的说话人区分学习

音频与语音处理 2025-06-10 v1 计算与语言 声音

摘要

本文提出了一种 novel 框架,用于无需额外信息进行多说人语音识别。序列化输出训练(SOT)这种广泛使用的方法由于说话人分配失败而存在识别错误。虽然 incorporating 额外信息(如标记级时间戳)可以提高识别准确率,但从自然对话语音中提取此类信息仍然具有挑战性。为解决这一局限性,我们提出了Speaker-Distinguishable CTC(SD-CTC),这是一种将每个帧与其对应的说话人标签一起分配的CTC扩展。我们进一步将SD-CTC集成到SOT框架中,使SOT模型仅能使用重叠语音和转录文本学习说话人区分。实验比较表明,结合SD-CTC和SOT的多任务学习可减少SOT模型的错误率26%,并实现与依赖额外信息的state-of-the-art方法相当的性能。

关键词

引用

@article{arxiv.2506.07515,
  title  = {Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition},
  author = {Asahi Sakuma and Hiroaki Sato and Ryuga Sugano and Tadashi Kumano and Yoshihiko Kawai and Tetsuji Ogawa},
  journal= {arXiv preprint arXiv:2506.07515},
  year   = {2025}
}

备注

Accepted at INTERSPEECH 2025