中文

M3SD:多模态、多场景、多语言说话人分割数据集

音频与语音处理 2025-07-01 v2 多媒体

摘要

在说话人分割领域,技术发展受到两个问题的制约:数据资源不足以及深度学习模型的泛化能力差。为解决这两个问题,我们首先提出了一种用于构建说话人分割数据集的自动化方法,通过音频和视频的结合,对大规模数据生成更精确的伪标签。依据此方法,我们发布了多模态、多场景、多语言说话人分割 (M3SD) 数据集。该数据集源于真实网络视频,具有高度的多样性。我们的数据集和代码已在 https://huggingface.co/spaces/OldDragon/m3sd 开源。

关键词

引用

@article{arxiv.2506.14427,
  title  = {M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset},
  author = {Shilong Wu},
  journal= {arXiv preprint arXiv:2506.14427},
  year   = {2025}
}