PITCH:利用挑战 - 响应机制进行 AI 辅助的深度伪造音频通话标记
声音
2025-05-27 v4 密码学与安全
音频与语音处理
摘要
AI 语音克隆技术,特别是实时音频深度伪造 (RTDFs) 的兴起,加剧了社会工程攻击,使得能够绕过传统基于注册的身份验证的实时语音冒充成为可能。这项技术对基于电话的身份验证系统构成了生存威胁,而整体身份欺诈损失已达到 430 亿美元。与传统的机器人电话不同,这些个性化的 AI 生成语音攻击针对高价值账户并规避现有的防御措施,构成了紧迫的网络安全挑战。为此,我们提出了 PITCH,一种用于检测和标记交互式深度伪造音频通话的稳健挑战 - 响应方法。我们基于人类听觉系统、语言学和 environmental 因素开发了全面的音频挑战分类法,产生了 20 种潜在挑战。使用一个新数据集(来自 100 名用户的 18,600 个原始样本和 160 万个深度伪造样本)针对领先的语音克隆系统进行测试,PITCH 的挑战将机器检测能力提升至 88.7% 的 AUROC 分数,使我们能够识别出 10 种高效挑战。对于人工评估,我们筛选出了一个具有挑战性且平衡的子集,在此子集上人工评估者独立达到了 72.6% 的准确率,而机器得分为 87.7%。认识到通话环境需要人工控制,我们开发了一种新型的人机协作系统,将可疑通话标记为“疑似深度伪造”。与先前的发现相反,我们发现将人类直觉与机器精度相结合提供了互补优势,在赋予用户最大控制权的同时将检测准确率提高到 84.5%。这一显著改进确立了 PITCH 作为验证通话的 AI 辅助预筛选器的潜力,提供了一种适应性强的方法来对抗实时语音克隆攻击,同时保持人类的决策权。
引用
@article{arxiv.2402.18085,
title = {PITCH: AI-assisted Tagging of Deepfake Audio Calls using Challenge-Response},
author = {Govind Mittal and Arthur Jakobsson and Kelly O. Marshall and Chinmay Hegde and Nasir Memon},
journal= {arXiv preprint arXiv:2402.18085},
year = {2025}
}
备注
To appear in ASIA CCS 2025. Human Instrument, Code and Dataset at https://govindm.me/pitch