AudioGuard:面向多样威胁模型的全方位音频安全保护
声音
2026-04-13 v1 人工智能
摘要
音频正迅速成为基础模型的主要界面,为实时语音助手提供动力。确保音频系统的安全性远比仅仅防止“口中说出不安全文本”更为复杂:现实风险可能取决于音频原生的有害声事件、说话者属性 (如儿童声音)、模仿/语音克隆滥用,以及声音-内容组合式危害,如儿童声音加性内容。音频的特性使得开发针对这一独特风险图景的全面基准或防御措施颇具挑战性。为弥合这一差距,我们对音频系统进行大规模的红队测试,系统性地揭示了音频中的漏洞,并开发了全面的、以政策为导向的音频风险分类法和 AudioSafetyBench——首个跨多样威胁模型的基于政策的音频安全基准。AudioSafetyBench 支持多种语言、可疑声音 (如名人/模仿和儿童声)、风险声音-内容组合以及非语音声事件。为对抗这些威胁,我们提出 AudioGuard,一个统一的防御框架,包括 1) SoundGuard 用于波形级别的音频原生检测和 2) ContentGuard 用于基于政策的语义保护。在 AudioSafetyBench 和四个互补基准上的大量实验表明,AudioGuard 在强大的音频-LLM 基线之上显著提高了防御准确度,同时延迟更低。
引用
@article{arxiv.2604.08867,
title = {AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models},
author = {Mintong Kang and Chen Fang and Bo Li},
journal= {arXiv preprint arXiv:2604.08867},
year = {2026}
}