中文

SC-SOT:基于说话人日记信息的解码器条件化用于端到端重叠语音识别

声音 2025-06-17 v1 计算与语言 音频与语音处理

摘要

我们提出了说话人条件化序列化输出训练(SC-SOT),一种用于端到端多说话人语音识别的增强 SOT 训练方法。我们首先探究了 SOT 如何处理重叠语音,发现解码器执行了隐式说话人分离。我们假设由于重叠区域中声学线索模糊,这种隐式分离往往是不充分的。为解决这一问题,SC-SOT 显式地以说话人信息为条件化输入,为模型提供"谁在何时说话"的详细信息。具体而言,我们通过以下方式增强解码器:(1) 说话人嵌入,使模型能够聚焦于目标说话人的声学特征;(2) 说话人活动信息,引导模型抑制非目标说话人。说话人嵌入来源于联合训练的端到端说话人日记模型,从而无需说话人注册。实验结果表明,我们的条件化方法在重叠语音上的有效性。

关键词

引用

@article{arxiv.2506.12672,
  title  = {SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition},
  author = {Yuta Hirano and Sakriani Sakti},
  journal= {arXiv preprint arXiv:2506.12672},
  year   = {2025}
}

备注

Accepted by Interspeech 2025