多说话人宽带模拟对话作为端到端神经日记化的训练数据
音频与语音处理
2023-02-27 v2 声音
摘要
端到端日记化是标准级联日记化系统的一个有吸引力的替代方案,因为单一系统可以一次性处理该任务的所有方面。已提出多种端到端模型变体,但它们都需要(目前尚不存在的)大量标注数据用于训练。折中方案是生成合成数据,且近期提出的模拟对话(SC)相比原始模拟混合(SM)已显示出显著改进。在本工作中,我们创建每轮对话包含多个说话人的 SC,并表明它们比 SM 允许明显更好的性能,同时也减少了对微调阶段的依赖。我们还使用宽带公共音频源创建 SC,并基于多个评估集给出分析。随本发表,我们发布了生成此类数据的配方、在公共集上训练的模型,以及高效处理每轮对话多说话人的实现和一个辅助语音活动检测损失。
引用
@article{arxiv.2211.06750,
title = {Multi-Speaker and Wide-Band Simulated Conversations as Training Data for End-to-End Neural Diarization},
author = {Federico Landini and Mireia Diez and Alicia Lozano-Diez and Lukáš Burget},
journal= {arXiv preprint arXiv:2211.06750},
year = {2023}
}
备注
Accepted by ICASSP 2023