用于神经说话人日志的预训练多说话人识别
音频与语音处理
2025-06-02 v1 声音
摘要
端到端说话人日志通过并行联合估计多个说话人的语音活动,实现了准确的感知重叠日志。这种方法对数据需求极大,需要大量带标注的对话数据,而这仅靠真实数据集无法完全满足。为解决此问题,通常使用大规模模拟数据进行预训练,但这需要巨大的存储和 I/O 容量,且模拟高度近似真实对话的数据仍具挑战性。在本文中,我们提出预训练一个从输入的完全重叠混合语音中识别多个说话人的模型,以此作为预训练日志模型的替代方案。该方法利用大规模说话人识别数据集进行训练,从而无需准备大规模模拟数据集。通过综合实验,我们证明所提出的方法无需模拟对话数据即可实现高精度且轻量级的局部日志模型。
引用
@article{arxiv.2505.24545,
title = {Pretraining Multi-Speaker Identification for Neural Speaker Diarization},
author = {Shota Horiguchi and Atsushi Ando and Marc Delcroix and Naohiro Tawara},
journal= {arXiv preprint arXiv:2505.24545},
year = {2025}
}
备注
Accepted to Interspeech 2025