VoxSafeBench:不仅关注言说内容,更关注说话人、方式与场景
声音
2026-04-21 v2 机器学习
音频与语音处理
摘要
随着语音语言模型(SLMs)从个人设备迁移至共享的多用户环境,其响应必须考虑的远不止于言语内容本身。说话人是谁、他们的语音特征如何、以及对话发生在何处,都可能将原本良性的请求转化为不安全、不公平或侵犯隐私的请求。然而,现有基准主要关注基础音频理解,或将各类风险独立研究,亦或混合了本质上有害的内容与仅因声学背景而产生问题的内容。我们引入VoxSafeBench,这是首批在三个维度(安全性、公平性与隐私性)联合评估社会对齐的基准之一。VoxSafeBench采用两层设计:Tier1使用匹配的文本与音频输入评估内容导向的风险,而Tier2针对音频条件化风险——即文字转录虽良性,但合适的响应却取决于说话人、语音线索或周围环境。为验证Tier2,我们包含中间感知探针,确认前沿SLMs能够成功检测这些声学线索,却仍未能恰当地应对。我们在覆盖双语的22项任务中发现,表面上对文本基准稳健的安全措施在语音环境下常常下降:对说话人和场景条件化的风险安全性下降,对声控民族差异的公平性受损,以及对上下文线索声学到达的隐私保护失效。总体而言,这些结果暴露了一种持续的语音 grounding 缺口:当前SLMs常在文本中识别相关社会规范,却在决定性线索必须基于语音时未能正确应用。代码与数据已公开提供:https://amphionteam.github.io/VoxSafeBench_demopage/
引用
@article{arxiv.2604.14548,
title = {VoxSafeBench: Not Just What Is Said, but Who, How, and Where},
author = {Yuxiang Wang and Hongyu Liu and Yijiang Xu and Qinke Ni and Li Wang and Wan Lin and Kunyu Feng and Dekun Chen and Xu Tan and Lei Wang and Jie Shi and Zhizheng Wu},
journal= {arXiv preprint arXiv:2604.14548},
year = {2026}
}