中文

ASRJam:人类友好型AI语音干扰以防止自动电话诈骗

计算与语言 2025-06-16 v1 人工智能

摘要

大语言模型(LLM)结合语音文本转换(TTS)和自动语音识别(ASR),日益用于自动化语音钓鱼(vishing)诈骗。这些系统规模化且令人信服,构成重大安全威胁。我们识别出语音识别步骤是诈骗链条中最脆弱的环节,提出ASRJam——一种主动防御框架,通过注入声音中的对抗性扰动来干扰攻击者的ASR。该框架在不影响人类通话者理解对话的同时,打破了诈骗的反馈回路。虽然现有对抗音频技术往往令人不适且难以用于实时应用,但我们还提出EchoGuard——一种新型干扰器,利用自然失真(如混响和回声),这些失真对ASR具有干扰性,但对人类听觉可接受。为评估EchoGuard的有效性与可用性,我们进行了39人的用户研究,比较了三种最先进的攻击方法。结果显示,EchoGuard在整体实用性方面取得最佳成绩,实现了ASR干扰与人类听觉体验的最佳组合。

关键词

引用

@article{arxiv.2506.11125,
  title  = {ASRJam: Human-Friendly AI Speech Jamming to Prevent Automated Phone Scams},
  author = {Freddie Grabovski and Gilad Gressel and Yisroel Mirsky},
  journal= {arXiv preprint arXiv:2506.11125},
  year   = {2025}
}