中文

FastAudio:一种用于欺骗语音检测的可学习音频前端

声音 2021-09-08 v1 密码学与安全 机器学习 音频与语音处理

摘要

语音助手(如智能音箱)已极度流行。目前估计美国成年人口中智能音箱普及率已超过35%。制造商已集成说话人识别技术,试图确定说话人身份,以向同一家庭的不同成员提供个性化服务。说话人识别在控制智能音箱使用方式上也可发挥重要作用。例如,播放音乐时正确识别用户并非关键。但在大声读出用户邮件时,正确验证发出请求的用户为授权用户则至关重要。因此,需要认证说话人身份的说者验证系统作为守门人,防范旨在冒充注册用户的各种欺骗攻击。本文比较了通过与该下游任务联合训练(端到端)来学习音频表示的热门可学习前端。我们通过定义两种通用架构对前端分类,并从学习约束角度分析两类前端中的滤波阶段。我们提出以可学习层替换固定滤波器组,以更好适应反欺骗任务。所提FastAudio前端随后与两种流行后端进行测试,以衡量在ASVspoof 2019数据集LA赛道上的性能。与固定前端相比,FastAudio前端实现了27%的相对提升,在此任务上优于所有其他可学习前端。

关键词

引用

@article{arxiv.2109.02774,
  title  = {FastAudio: A Learnable Audio Front-End for Spoof Speech Detection},
  author = {Quchen Fu and Zhongwei Teng and Jules White and Maria Powell and Douglas C. Schmidt},
  journal= {arXiv preprint arXiv:2109.02774},
  year   = {2021}
}