中文

端到端神经说话人日志中的吸引子是否需要编码说话人特征信息?

声音 2024-06-21 v2 音频与语音处理

摘要

在本文中,我们将变分信息瓶颈方法应用于具有编码器-解码器吸引子的端到端神经说话人日志(EEND-EDA)。这使我们能够研究哪些信息对模型是必要的。EEND-EDA 利用吸引子,即对话中说话人的向量表示。我们的分析表明,吸引子不一定需要包含说话人特征信息。另一方面,给予吸引子更多自由度以允许其编码一些额外的(可能是说话人特定的)信息,会带来虽小但一致的说话人日志性能提升。尽管 EEND 系统在架构上存在差异,但吸引子和帧嵌入的概念对大多数系统来说是通用的,并非 EEND-EDA 所特有。我们相信这项工作的主要结论可以应用于 EEND 的其他变体。因此,我们希望本文能成为有价值的贡献,指导社区在设计新系统时做出更明智的决策。

关键词

引用

@article{arxiv.2402.19325,
  title  = {Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?},
  author = {Lin Zhang and Themos Stafylakis and Federico Landini and Mireia Diez and Anna Silnova and Lukáš Burget},
  journal= {arXiv preprint arXiv:2402.19325},
  year   = {2024}
}

备注

Accepted to Odyssey 2024. This arXiv version includes an appendix for more visualizations. Code: https://github.com/BUTSpeechFIT/EENDEDA_VIB