利用说话人嵌入增强双说话人场景下的端到端神经说话人聚类
声音
2024-07-02 v1 人工智能
音频与语音处理
摘要
端到端神经说话人聚类系统能够有效处理语音重叠,同时解决说话人聚类任务。本工作探索了将说话人信息嵌入整合到端到端系统中,以增强说话人判别能力,同时保持其重叠处理优势。为实现这一目标,我们提出了几种方法将这些嵌入沿声学特征进行整合。此外,我们深入分析了正确处理静音帧、提取说话人嵌入的窗口长度以及变换器编码器大小。我们在 CallHome 数据集上对该方法在双说话人说话人聚类任务中的有效性进行了彻底评估,结果显示相对于基线端到端模型,实现了约 10.78% 的相对改进。
引用
@article{arxiv.2407.01317,
title = {Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios},
author = {Juan Ignacio Alvarez-Trejos and Beltrán Labrador and Alicia Lozano-Diez},
journal= {arXiv preprint arXiv:2407.01317},
year = {2024}
}
备注
Submitted to Odyssey 2024