中文

Audio Language Models应遵循最小特权原则

声音 2025-09-10 v2 人工智能 计算与语言 计算机与社会 音频与语音处理

摘要

最新的Audio Language Models(音频语言模型)直接处理语音,而不依赖单独的转录步骤。这种转变保留了细节信息,如语调或多说话者的存在,这些信息在转录过程中会丢失。然而,这也引入了新的安全风险,包括可能滥用说话者身份线索和其他敏感声学特征,这可能在法律上产生风险。本文我们敦促更深入地审查这些模型的构建方式和部署方式。我们的实验表明,端到端建模相对于级联管道会创建社会技术安全风险,如身份推断、偏见决策和情感检测。这引发了关于Audio LMs是否存储声纹以及以何种方式运行以在现有法律框架下产生不确定性的担忧。随后,我们主张应考虑最小特权原则来指导这些模型的开发和部署。具体而言,评估应 Assess (1)端到端建模所带来的隐私和安全风险;和 (2)信息访问的合适范围。最后,我们指出当前音频LM基准测试存在的相关缺口,并确定了一系列技术和政策相关的关键开放性研究问题,以实现端到端Audio LMs的负责任部署。

关键词

引用

@article{arxiv.2503.16833,
  title  = {The Model Hears You: Audio Language Model Deployments Should Consider the Principle of Least Privilege},
  author = {Luxi He and Xiangyu Qi and Michel Liao and Inyoung Cheong and Prateek Mittal and Danqi Chen and Peter Henderson},
  journal= {arXiv preprint arXiv:2503.16833},
  year   = {2025}
}

备注

Published at AIES 2025