中文

ELAD-SVDSR:用于合成语音检测与说话人识别的扩展长度音频数据集

音频与语音处理 2025-10-02 v1 声音

摘要

本文介绍了用于合成语音检测与说话人识别的扩展长度音频数据集(ELAD SVDSR),这是一种专门设计的资源,旨在促进高质量 deepfakes 的创建并支持针对它们训练检测系统的开发。该数据集包含来自 36 名参与者的 45 分钟音频录音,每名参与者在受控条件下阅读各种报纸文章,并通过五个不同质量的麦克风进行录制。通过关注长时音频,ELAD SVDSR 捕获了更丰富的语音属性范围,如基频轮廓、语调模式和细微的传达方式,使模型能够生成更逼真且连贯的合成语音。反过来,这种方法允许创建稳健的 deepfakes,可作为用于训练和评估合成语音检测方法的数据集中的挑战性样本。作为这项工作的一部分,已经创建了 20 个 deepfake 语音并添加到数据集中,以展示其潜力。数据集附带关于说话人人口统计特征的匿名元数据。ELAD SVDSR 有望推动音频取证、生物特征安全和语音认证系统的重大进展。

关键词

引用

@article{arxiv.2510.00218,
  title  = {Descriptor:: Extended-Length Audio Dataset for Synthetic Voice Detection and Speaker Recognition (ELAD-SVDSR)},
  author = {Rahul Vijaykumar and Ajan Ahmed and John Parker and Dinesh Pendyala and Aidan Collins and Stephanie Schuckers and Masudul H. Imtiaz},
  journal= {arXiv preprint arXiv:2510.00218},
  year   = {2025}
}