中文

通过选择性听觉保护听众隐私:面向音频大语言模型

声音 2026-04-22 v3 人工智能

摘要

音频大语言模型(Audio LLMs)正在实际场景中部署,由于不可避免地捕获附近无意识听众的语音,导致现有基准测试和防御措施未能考虑的隐私风险。我们引入了SH-Bench,这是第一个专为评估选择性听觉而设计的基准测试:模型在针对意图主要说话者的同时,拒绝处理或泄露关于意外旁听者语音信息的能力。SH-Bench包含3,968个多说话者音频混合音料,包括真实场景和合成场景,配有77,000个多选题,探测模型在通用和选择性操作模式下的表现。此外,我们提出了选择性有效性(Selective Efficacy, SE)指标,旨在衡量多说话者理解能力与旁听者隐私保护能力。我们的评估显示,当前最先进的开源和专有LLM在旁听者隐私泄露方面存在显著问题,强大的音频理解能力并不等同于对旁听者隐私的选择性保护。为弥合这一差距,我们还提出了旁听者隐私微调(Bystander Privacy Fine-Tuning, BPFT)方法,这是一种教会模型拒绝与旁听者相关查询,而不降低主要说话者理解能力的新型训练流程。我们表明,BPFT显著提升了表现,在选择性模式下旁听者准确率提高了47个百分点,SE指标提高了16个百分点,这是相对于目前最好的音频LLM——Gemini 2.5 Pro所实现的。总之,SH-Bench和BPFT为音频LLM的旁听者隐私测量与改进提供了首个系统化框架。

关键词

引用

@article{arxiv.2512.06380,
  title  = {Protecting Bystander Privacy via Selective Hearing in Audio LLMs},
  author = {Xiao Zhan and Guangzhi Sun and Jose Such and Phil Woodland},
  journal= {arXiv preprint arXiv:2512.06380},
  year   = {2026}
}

备注

To Appear at ACL 2026 main conference; Dataset: https://huggingface.co/datasets/BrianatCambridge/SelectiveHearingBench