中文

保护语音驱动接口免受伪造(克隆)音频攻击

音频与语音处理 2019-02-20 v1 声音

摘要

语音克隆技术已在从个性化语音接口到广告、机器人等众多领域中得到应用。现有语音克隆系统能够学习说话人特征,并利用训练好的模型仅从少量音频样本合成一个人的语音。克隆语音生成技术的进展能够生成与真实语音在感知上无法区分的语音。这些进展对语音驱动接口和基于语音的访问控制系统构成了新的安全与隐私威胁。最先进的语音合成技术使用训练或微调的生成模型来生成克隆语音。训练好的生成模型依赖线性运算、学习到的权重和激励源来合成克隆语音。这些系统会在合成语音中留下特征性伪影。高阶谱分析用于捕捉真实音频与克隆音频之间的区分属性。具体而言,估计双相干中的正交相位耦合(QPC)、高斯性检验统计量和线性检验统计量被用于捕捉生成模型伪影。所提方法的性能在采用基于说话人自适应和基于说话人编码方法生成的克隆音频上进行了评估。由 126 个克隆语音和 8 个真实语音样本组成的数据集上的实验结果表明,所提方法能够以接近完美的检测率检测真实与克隆音频。

关键词

引用

@article{arxiv.1902.06782,
  title  = {Securing Voice-driven Interfaces against Fake (Cloned) Audio Attacks},
  author = {Hafiz Malik},
  journal= {arXiv preprint arXiv:1902.06782},
  year   = {2019}
}

备注

6 pages, The 2nd IEEE International Workshop on "Fake MultiMedia" (FakeMM'19) March 28-30, 2019, San Jose, CA, USA