VoxPrivacy:评估语音语言模型交互式隐私的基准
音频与语音处理
2026-01-29 v1 人工智能
声音
摘要
随着语音语言模型(SLMs)从个人设备迁移至共享的多用户环境(如智能家居),一个新挑战浮现:模型需要能够区分用户以appropriate地管理信息流。若缺乏此能力,SLM可能泄露某一用户的机密日程信息给另一用户,这是一种隐私失效,我们称之为交互式隐私。因此,生成带用户感知响应的能力对于SLM的安全部署至关重要。当前的SLM基准测试对话能力,但忽略了说话人身份。多说话人基准测试检查谁说了什么,却未评估SLM是否调整其响应。隐私基准测试聚焦于全局敏感数据(如银行密码),而忽视情境隐私敏感信息(如用户的私人约会)。为弥合这一差距,我们引入VoxPrivacy,第一个专为评估SLMs交互式隐私而设计的基准。VoxPrivacy涵盖三个难度递增的层级,从跟随直接保密命令到主动保护隐私。我们在32小时双语数据集上评估了九个SLMs,发现大多数开源模型在条件隐私决策上接近随机 guessing(约50%准确率),即使是强大的闭源系统在主动隐私推断方面也表现不足。我们进一步在Real-VoxPrivacy子集上验证了这些发现,确认合成数据中观察到的失效在真实语音中同样存在。最后,我们展示了一条可行的道路:通过在新的4000小时训练集上微调,我们在保持鲁棒性的同时提升了隐私保护能力。为支持未来工作,我们发布了VoxPrivacy基准、大规模训练集以及微调后的模型,以促进更安全、更具情境感知能力的SLMs的发展。
引用
@article{arxiv.2601.19956,
title = {VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models},
author = {Yuxiang Wang and Hongyu Liu and Dekun Chen and Xueyao Zhang and Zhizheng Wu},
journal= {arXiv preprint arXiv:2601.19956},
year = {2026}
}