合成语音、真实威胁:评估大型文本转语音模型生成有害音频
声音
2025-11-17 v1 人工智能
密码学与安全
多媒体
音频与语音处理
摘要
现代文本转语音(TTS)系统,特别是基于大型音频语言模型(LALM)的系统,能够生成高保真度的语音,忠实地复现输入文本并模拟指定说话人身份。虽然先前的滥用研究聚焦于说话人冒充,但本工作探索了一种不同于内容导向的威胁:利用 TTS 系统生成包含有害内容的语音。实现此类威胁面临两个核心挑战:(1)LALM 安全对齐频繁拒绝有害提示,但现有的越狱攻击不适用于 TTS,因为这些系统被设计为忠实地朗读任何输入文本;(2)现实世界的部署管道通常采用输入/输出过滤器,可阻止有害文本和音频。我们提出了 HARMGEN,一套由五个攻击组成的套件,分为两个家族以解决这些挑战。第一个家族采用语义混淆技术(Concat、Shuffle),将有害内容隐藏在文本中。第二个家族利用音频模式漏洞(Read、Spell、Phoneme),通过辅助音频通道注入有害内容,同时保持无害的文本提示。在针对五个基于 LALM 的商业 TTS 系统和三个跨两语言的数据集进行评估后,我们展示了这些攻击显著降低了拒绝率并增加了生成语音的毒性。我们进一步评估了音频流媒体平台部署的反应性防御措施以及 TTS 提供商实施的主动防御措施。我们的分析揭示了关键漏洞:深度伪造检测器在高保真音频上表现不佳;反应性 moderation 可被对抗性扰动所规避;而主动 moderation 可检测 57%-93% 的攻击。我们的工作凸显了 TTS 之前被忽视的内容导向滥用向量,强调在训练和部署期间需要 robust 的跨模态安全措施。
引用
@article{arxiv.2511.10913,
title = {Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio},
author = {Guangke Chen and Yuhui Wang and Shouling Ji and Xiapu Luo and Ting Wang},
journal= {arXiv preprint arXiv:2511.10913},
year = {2025}
}