LALM-as-a-Judge:面向多轮语音对话安全评估的大型音频语言模型基准
音频与语音处理
2026-02-05 v1 声音
摘要
语音对话(包括与语音代理之间的对话)正变得越来越常见,但对其进行社会有害内容(如暴力、骚扰、仇恨)的评估仍以文本为中心,未能考虑音频特有的线索和转录误差。我们提出LALM-as-a-Judge,是第一个为多轮语音对话安全评估设计的控制基准和系统性研究,评估大型音频语言模型(LALM)作为安全裁判。我们生成24,000个不安全且合成的英文语音对话,包含3-10轮,对话中包含一种8种有害类别(如暴力)的内容,并按5个等级(从轻微到严重)进行划分。在160个对话上,5名人类评审者确认了可靠的不安全检测和有意义的严重程度尺度。我们对三个开源 LALM:Qwen2-Audio、Audio Flamingo 3和MERaLiON进行基准测试,作为零-shot 裁判,输出[0,1]范围内的标量安全分数,支持音频-only、转录-only或多模态输入,同时包括一个仅基于转录的 LLaMA基线。我们衡量裁判检测不安全内容的灵敏度、对严重程度排序的特异性以及在对话轮次中的分数稳定性。结果揭示了架构和模态之间的权衡:最灵敏的裁判也是跨轮次最不稳定的,而稳定的配置则牺牲了对轻微有害内容的检测。转录质量是关键瓶颈:Whisper-Large可能显著降低转录-only模式下的灵敏度,但基本保持了严重程度排序。当对称语言线索或转录保真度至关重要时,音频变得至关重要。我们总结了所有发现,为实践者提供可操作的指导。
引用
@article{arxiv.2602.04796,
title = {LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues},
author = {Amir Ivry and Shinji Watanabe},
journal= {arXiv preprint arXiv:2602.04796},
year = {2026}
}