M3SD:多模态、多场景、多语言说话人分割数据集
音频与语音处理
2025-07-01 v2 多媒体
摘要
在说话人分割领域,技术发展受到两个问题的制约:数据资源不足以及深度学习模型的泛化能力差。为解决这两个问题,我们首先提出了一种用于构建说话人分割数据集的自动化方法,通过音频和视频的结合,对大规模数据生成更精确的伪标签。依据此方法,我们发布了多模态、多场景、多语言说话人分割 (M3SD) 数据集。该数据集源于真实网络视频,具有高度的多样性。我们的数据集和代码已在 https://huggingface.co/spaces/OldDragon/m3sd 开源。
引用
@article{arxiv.2506.14427,
title = {M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset},
author = {Shilong Wu},
journal= {arXiv preprint arXiv:2506.14427},
year = {2025}
}