中文

基于学习支配的序列化输出训练

声音 2024-07-08 v1 人工智能 音频与语音处理

摘要

序列化输出训练 (SOT) 已在多说话人语音识别中展示了卓越的性能,通过顺序解码单个说话者的语音。为解决标签置换问题,先前方法依赖于置换不变训练 (PIT) 或基于时间的先进先出 (FIFO) 规则。本研究提出一种基于模型的序列化策略,将辅助模块集成到注意力编码器-解码器架构中,自动识别对多说话人语音输出序列进行排序的关键因素。在 LibriSpeech 和 LibriMix 数据集上的实验表明,我们的方法在 2-mix 和 3-mix 场景中均显著优于 PIT 和 FIFO 基线。进一步分析显示,序列化模块通过包括响度和性别等因素识别混合语音中的支配性语音成分,并根据支配得分对语音成分进行排序。

关键词

引用

@article{arxiv.2407.03966,
  title  = {Serialized Output Training by Learned Dominance},
  author = {Ying Shi and Lantian Li and Shi Yin and Dong Wang and Jiqing Han},
  journal= {arXiv preprint arXiv:2407.03966},
  year   = {2024}
}

备注

accepted by INTERSPEECH 2024