面向深度伪造语音转换的 AI 生成语音实时检测
声音
2023-08-25 v1 计算与语言
人机交互
机器学习
音频与语音处理
摘要
语音领域中生成式 AI 的影响日益扩大,其能够实现语音克隆及个体间的实时语音转换。该技术构成显著的伦理威胁,并可能导致隐私泄露与身份冒用,因此亟需面向深度伪造语音转换(DeepFake Voice Conversion)的 AI 生成语音实时检测。为解决上述新兴问题,本研究生成了 DEEP-VOICE 数据集,包含八位知名人物的真实人类语音及使用基于检索的语音转换(Retrieval-based Voice Conversion)相互转换的语音。作为语音真实或 AI 生成的二分类问题,通过 t 检验对时序音频特征的统计分析显示其分布存在显著差异。为实现语音来源识别,对机器学习模型进行了超参数优化。在对 208 个独立机器学习模型进行 10 折交叉验证训练后,发现极端梯度提升(Extreme Gradient Boosting)模型可达到 99.3% 的平均分类准确率,并能以约 0.004 毫秒(给定一秒语音)实时分类语音。本研究生成的所有数据均已公开,以供未来 AI 语音检测研究使用。
引用
@article{arxiv.2308.12734,
title = {Real-time Detection of AI-Generated Speech for DeepFake Voice Conversion},
author = {Jordan J. Bird and Ahmad Lotfi},
journal= {arXiv preprint arXiv:2308.12734},
year = {2023}
}