中文

TalTech-IRIT-LIS 说话人及语种分割系统用于 DISPLACE 2024

音频与语音处理 2024-07-18 v1

摘要

本文描述了 TalTech-IRIT-LIS 团队提交给 DISPLACE 2024 挑战赛的系统。我们团队参与了挑战赛的说话人分割和语种分割赛道。在说话人分割赛道中,我们最佳提交方案是基于 pyannote.audio 说话人分割流程的系统集成,该流程利用了幂集训练和我们最近提出的 PixIT 方法,该方法执行联合分割与语音分离。我们通过使用分离输出进行说话人嵌入提取来改进 PixIT。我们的集成系统在评估数据集上取得了 27.1% 的说话人分割错误率。在语种分割赛道中,我们在领域内数据上微调了一个预训练的 Wav2Vec2-BERT 语言嵌入模型,并基于 LDA/PLDA 的相似度分数,使用 AHC 和 VBx 对短片段进行聚类。这导致在评估数据上取得了 27.6% 的语种分割错误率。这两项结果均在各自挑战赛道中排名第一。

关键词

引用

@article{arxiv.2407.12743,
  title  = {TalTech-IRIT-LIS Speaker and Language Diarization Systems for DISPLACE 2024},
  author = {Joonas Kalda and Tanel Alumäe and Martin Lebourdais and Hervé Bredin and Séverin Baroudi and Ricard Marxer},
  journal= {arXiv preprint arXiv:2407.12743},
  year   = {2024}
}

备注

accepted at Interspeech 2024