自监督表征学习在说话人日记化与语音分离中的应用
音频与语音处理
2025-12-18 v1
摘要
自监督语音模型如wav2vec2.0和WavLM已被证明在过去几年中显著提升了许多下游语音任务的性能,特别是在低资源场景中。尽管如此,对说话人日记化和语音分离等任务的评估仍然有限。本文研究了近期自监督语音表征在这两个与说话人身份相关任务上的质量,指出了当前文献中的空白,这些空白源于现有基准的局限性,特别是评估数据集缺乏多样性以及与日记化和分离相关的下游系统种类不足。
引用
@article{arxiv.2512.15224,
title = {On the Use of Self-Supervised Representation Learning for Speaker Diarization and Separation},
author = {Séverin Baroudi and Hervé Bredin and Joseph Razik and Ricard Marxer},
journal= {arXiv preprint arXiv:2512.15224},
year = {2025}
}
备注
accepted at ASRU25