中文

面向多说话人自动语音识别的序列化语音信息引导与重叠编码分离

声音 2024-09-12 v3 人工智能 音频与语音处理

摘要

序列化输出训练(SOT)因其在多说话人自动语音识别(ASR)中的便利性和灵活性而受到越来越多的关注。然而,仅使用注意力损失进行训练并非易事。在本文中,我们提出了重叠编码分离(EncSep)方法,以充分利用连接时序分类(CTC)和注意力混合损失的优势。这个额外的分离器被插入到编码器之后,利用CTC损失提取多说话人信息。此外,我们提出了序列化语音信息引导SOT(GEncSep),以进一步利用分离后的编码。分离后的流被连接起来,以提供单说话人信息,在解码过程中引导注意力。在LibriMix上的实验结果表明,单说话人编码可以从重叠编码中分离出来。CTC损失有助于改善复杂场景下的编码器表示。GEncSep进一步提升了性能。

关键词

引用

@article{arxiv.2409.00815,
  title  = {Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition},
  author = {Hao Shi and Yuan Gao and Zhaoheng Ni and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2409.00815},
  year   = {2024}
}