中文

洞察移动大语言模型智能体的隐私意识:构建基准测试

密码学与安全 2025-09-04 v2 计算机视觉与模式识别

摘要

智能手机为用户带来了便利,同时也使设备能够广泛记录多种类型的个人信息。现有以多模态大语言模型(MLLM)为驱动的智能手机智能体在自动化不同任务方面取得了显著成绩。然而,正是由于成本考量,这些智能体在运行过程中获得了对用户敏感个人信息的广泛访问权限。为全面了解这些智能体的隐私意识,我们本文构建了首个涵盖7,138个情景的大规模基准测试(据称是目前最全之一)。此外,针对情景中的隐私情境,我们标注其类型(如帐户凭证)、敏感程度及位置信息。随后,我们仔细评估了七个主流智能手机智能体。我们的结果表明,几乎所有被评估的智能体在隐私意识方面表现不佳,即使在明确提示下表现也低于60%。总体而言,闭源智能体在隐私能力上优于开源智能体,Gemini 2.0-flash取得最佳成绩,达到67%。我们还发现,智能体的隐私检测能力与情景敏感程度密切相关,即敏感程度越高的情景越容易被识别。我们希望这些发现能启发学术界重新思考智能手机智能体中的效用与隐私之间的不平衡权衡。我们的代码和基准测试已公开于https://zhixin-l.github.io/SAPA-Bench。

关键词

引用

@article{arxiv.2508.19493,
  title  = {Mind the Third Eye! Benchmarking Privacy Awareness in MLLM-powered Smartphone Agents},
  author = {Zhixin Lin and Jungang Li and Shidong Pan and Yibo Shi and Yue Yao and Dongliang Xu},
  journal= {arXiv preprint arXiv:2508.19493},
  year   = {2025}
}