重塑表示空间以平衡大型音频语言模型的安全性与过度拒绝
计算与语言
2025-05-27 v1 多媒体
声音
音频与语音处理
摘要
大型音频语言模型通过支持基于音频的人机交互,扩展了大型语言模型的能力。然而,最近的研究表明,由于安全对齐不足,LALMs 仍然容易受到有害查询的攻击。尽管文本和视觉 LLMs 的防御措施取得了进展,但专门针对 LALMs 的有效安全对齐策略和音频安全数据集仍然明显缺失。同时,基于监督微调的防御措施在避免过度拒绝问题的同时难以提升安全性,显著损害了模型的可用性。在这项工作中,我们提出了一种无监督安全微调策略作为补救措施,通过重塑模型的表示空间来增强现有 LALMs 的安全对齐,同时平衡过度拒绝的风险。我们在三代 Qwen LALMs 上进行的实验表明,我们的方法在三种模态输入条件(音频-文本、纯文本和纯音频)下显著提升了 LALMs 的安全性,而过度拒绝率平均仅增加 0.88%。警告:本文包含有害示例。
引用
@article{arxiv.2505.19670,
title = {Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models},
author = {Hao Yang and Lizhen Qu and Ehsan Shareghi and Gholamreza Haffari},
journal= {arXiv preprint arXiv:2505.19670},
year = {2025}
}