中文

TidyVoice:源自 Common Voice 的用于说话人验证的精选多语言数据集

音频与语音处理 2026-01-26 v1 声音

摘要

鲁棒的多语言说话人识别系统的发展受到缺乏大规模、公开可用且多语言数据集的阻碍,特别是对于反欺骗等应用至关重要的朗读语音风格。为弥补这一空白,我们引入了 TidyVoice 数据集,该数据集源自 Mozilla Common Voice 语料库,并在缓解其提供的客户端 ID 内固有的说话人异质性后得到。TidyVoice 目前包含来自超过212,000名单语说话人(Tidy-M)和约4,500名多语说话人(Tidy-X)的训练和测试数据,我们从中衍生出两种不同的条件。Tidy-M 条件包含来自81种语言的单语说话人的目标和非目标试次。Tidy-X 条件包含来自多语说话人的目标和非目标试次,包括同语言和跨语言试次。我们采用了两种 ResNet 模型架构,通过在全面的 Tidy-M 分区上进行微调,实现了0.35%的等错误率。此外,我们表明这种微调增强了模型的泛化能力,提高了在来自 CANDOR 语料库的未见对话访谈数据上的性能。完整的数据集、评估试次和我们的模型已公开发布,为社区提供新的资源。

关键词

引用

@article{arxiv.2601.16358,
  title  = {TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common Voice},
  author = {Aref Farhadipour and Jan Marquenie and Srikanth Madikeri and Eleanor Chodroff},
  journal= {arXiv preprint arXiv:2601.16358},
  year   = {2026}
}

备注

Accepted at ICASSP 2026