大型音频语言模型面对聊天音频攻击的韧性评估基准
声音
2025-06-09 v2 人工智能
音频与语音处理
摘要
对抗音频攻击对日益增长的大型音频语言模型 (LALM) 在语音交互中的应用构成严重威胁。虽然现有研究聚焦于模型特定的对抗方法,但实际应用需要更通用和普适的音频攻击方法。本文引入了 Chat-Audio Attacks (CAA) 基准,包括四种不同类型的音频攻击,旨在探讨 LALM 在对话场景中针对这些音频攻击的脆弱性。为评估 LALM 的韧性,我们提出了三种评估策略:标准评估,利用传统指标量化模型在攻击下的性能;GPT-4o 基于评估,模拟真实世界对话的复杂性;人类评估,提供用户感知和信任的洞察。我们对六个具有语音交互能力的前沿 LALM 进行了评估,包括 Gemini-1.5-Pro、GPT-4o 等,使用 CAA 基准上的三种不同评估方法。我们的全面分析揭示了这四种音频攻击对这些模型性能的影响,表明 GPT-4o 表现出最高的韧性。我们的数据可通过以下链接访问:\href{https://github.com/crystraldo/CAA}{CAA}。
引用
@article{arxiv.2411.14842,
title = {Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models},
author = {Wanqi Yang and Yanda Li and Meng Fang and Yunchao Wei and Ling Chen},
journal= {arXiv preprint arXiv:2411.14842},
year = {2025}
}
备注
Accepted by ACL 2025 Findings