声音背后的男人:通过多模态大语言模型智能体解构音频私有属性轮廓
密码学与安全
2025-08-21 v2 声音
音频与语音处理
摘要
我们的研究揭示了多模态大语言模型(MLLMs)从音频数据推断敏感个人属性的新型隐私风险,称为音频私有属性轮廓。这种能力构成重大威胁,因为音频可在无需直接互动或可见性的情况下被窃取。此外,与图像和文本相比,音频具有独特特征(如语调和音调),可被用于更详细的轮廓描绘。然而,理解 MLLM 就音频私有属性轮廓 employed 的两个关键挑战存在:(1)缺乏带有敏感属性标注的音频基准数据集,(2)当前 MLLM 直接从音频推断此类属性的能力有限。为解决这些挑战,我们引入了 AP^2,一个由真实世界数据收集和组成的音频基准数据集,包含两个子集并标注了敏感属性标签。此外,我们提出了 Gifts,一种混合多智能体框架,利用音频-语言模型(ALMs)和大语言模型(LLMs)的互补优势来增强推断能力。Gifts 采用 LLM 指导 ALM 推断敏感属性,然后对 ALM 的推断进行剖析和整合,克服了现有 ALMs 在生成长上下文响应方面的严重幻觉问题。我们的评估表明,Gifts 在推断敏感属性方面显著优于基线方法。最后,我们探讨了模型层面和数据层面的防御策略,以缓解音频私有属性轮廓的风险。我们的工作验证了使用 MLLM 进行基于音频的隐私攻击的可行性,突显了需要强大防御的必要性,并提供了一个数据集和框架来促进未来研究。
引用
@article{arxiv.2507.10016,
title = {The Man Behind the Sound: Demystifying Audio Private Attribute Profiling via Multimodal Large Language Model Agents},
author = {Lixu Wang and Kaixiang Yao and Xinfeng Li and Dong Yang and Haoyang Li and Xiaofeng Wang and Wei Dong},
journal= {arXiv preprint arXiv:2507.10016},
year = {2025}
}
备注
22 pages, 4 figures