TidyVoice:源自 Common Voice 的用于说话人验证的精选多语言数据集
音频与语音处理
2026-01-26 v1 声音
摘要
鲁棒的多语言说话人识别系统的发展受到缺乏大规模、公开可用且多语言数据集的阻碍,特别是对于反欺骗等应用至关重要的朗读语音风格。为弥补这一空白,我们引入了 TidyVoice 数据集,该数据集源自 Mozilla Common Voice 语料库,并在缓解其提供的客户端 ID 内固有的说话人异质性后得到。TidyVoice 目前包含来自超过212,000名单语说话人(Tidy-M)和约4,500名多语说话人(Tidy-X)的训练和测试数据,我们从中衍生出两种不同的条件。Tidy-M 条件包含来自81种语言的单语说话人的目标和非目标试次。Tidy-X 条件包含来自多语说话人的目标和非目标试次,包括同语言和跨语言试次。我们采用了两种 ResNet 模型架构,通过在全面的 Tidy-M 分区上进行微调,实现了0.35%的等错误率。此外,我们表明这种微调增强了模型的泛化能力,提高了在来自 CANDOR 语料库的未见对话访谈数据上的性能。完整的数据集、评估试次和我们的模型已公开发布,为社区提供新的资源。
引用
@article{arxiv.2601.16358,
title = {TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common Voice},
author = {Aref Farhadipour and Jan Marquenie and Srikanth Madikeri and Eleanor Chodroff},
journal= {arXiv preprint arXiv:2601.16358},
year = {2026}
}
备注
Accepted at ICASSP 2026