中文

基于记忆感知多说话人嵌入与序列到序列架构的神经说话人日志系统

音频与语音处理 2023-12-27 v2 人工智能 声音

摘要

我们提出了一种新颖的基于记忆感知多说话人嵌入与序列到序列架构的神经说话人日志系统(NSD-MS2S),它集成了记忆感知多说话人嵌入(MA-MSE)与序列到序列(Seq2Seq)架构的优势,从而在效率与性能上均取得提升。接下来,我们通过引入输入特征融合进一步降低解码的内存占用,并采用多头注意力机制以捕获不同层级的特征。NSD-MS2S 在 CHiME-7 EVAL 集上取得了 15.9% 的宏说话人日志错误率(DER),相较官方基线系统实现了 49% 的相对提升,并且是我们于 CHiME-7 DASR 挑战赛主赛道取得最佳性能的关键技术。此外,我们在 MA-MSE 模块中引入深度交互模块(DIM),以更好地提取更干净且更具判别力的多说话人嵌入,使当前模型超越我们在 CHiME-7 DASR 挑战赛中使用的系统。我们的代码将发布于 https://github.com/liyunlongaaa/NSD-MS2S。

关键词

引用

@article{arxiv.2309.09180,
  title  = {Neural Speaker Diarization Using Memory-Aware Multi-Speaker Embedding with Sequence-to-Sequence Architecture},
  author = {Gaobin Yang and Maokui He and Shutong Niu and Ruoyu Wang and Yanyan Yue and Shuangqing Qian and Shilong Wu and Jun Du and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:2309.09180},
  year   = {2023}
}

备注

Accepted by ICASSP 2024