中文

SuperVoice:利用人语音中超声能量的文本无关说话人验证

声音 2022-05-31 v1 人机交互 机器学习 音频与语音处理

摘要

语音激活系统已集成到多种桌面、移动和物联网(IoT)设备中。然而,语音欺骗攻击(如冒充和重放攻击,恶意攻击者合成受害者语音或简单重放)带来了日益增长的安全担忧。现有说话人验证技术通过从语音命令的可听频率范围提取的谱图特征来区分个体说话人。但它们通常有高错误率和/或长延迟。在本文中,我们通过审视人语音在超声频带的独特特征,探索了人类语音研究的新方向。我们的研究表明,20 至 48 kHz 的高频超声成分(如语音擦音)可显著增强说话人验证的安全性和准确性。我们提出了一种说话人验证系统 SUPERVOICE,其使用具有特征融合机制的双流 DNN 架构来生成独特的说话人模型。为测试该系统,我们创建了一个包含来自 127 名参与者的 12 小时音频(8,950 条语音样本)的语音数据集。此外,我们创建了第二个欺骗语音数据集以评估其安全性。为在受控录音与真实应用间取得平衡,音频录音由 8 种不同录音设备(包括 7 部智能手机和一支超声麦克风)从两个安静房间采集。我们的评估显示,SUPERVOICE 在说话人验证任务中达到 0.58% 等错误率,测试一条 incoming utterance 仅需 120 ms,优于所有现有说话人验证系统。此外,在 91 ms 处理时间内,SUPERVOICE 在检测由 5 种不同扬声器发起的重放攻击中达到 0% 等错误率。

关键词

引用

@article{arxiv.2205.14496,
  title  = {SuperVoice: Text-Independent Speaker Verification Using Ultrasound Energy in Human Speech},
  author = {Hanqing Guo and Qiben Yan and Nikolay Ivanov and Ying Zhu and Li Xiao and Eric J. Hunter},
  journal= {arXiv preprint arXiv:2205.14496},
  year   = {2022}
}