SC-SOT:基于说话人日记信息的解码器条件化用于端到端重叠语音识别
声音
2025-06-17 v1 计算与语言
音频与语音处理
摘要
我们提出了说话人条件化序列化输出训练(SC-SOT),一种用于端到端多说话人语音识别的增强 SOT 训练方法。我们首先探究了 SOT 如何处理重叠语音,发现解码器执行了隐式说话人分离。我们假设由于重叠区域中声学线索模糊,这种隐式分离往往是不充分的。为解决这一问题,SC-SOT 显式地以说话人信息为条件化输入,为模型提供"谁在何时说话"的详细信息。具体而言,我们通过以下方式增强解码器:(1) 说话人嵌入,使模型能够聚焦于目标说话人的声学特征;(2) 说话人活动信息,引导模型抑制非目标说话人。说话人嵌入来源于联合训练的端到端说话人日记模型,从而无需说话人注册。实验结果表明,我们的条件化方法在重叠语音上的有效性。
引用
@article{arxiv.2506.12672,
title = {SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition},
author = {Yuta Hirano and Sakriani Sakti},
journal= {arXiv preprint arXiv:2506.12672},
year = {2025}
}
备注
Accepted by Interspeech 2025