MobileSafetyBench:评估移动设备控制中自主智能体的安全性
机器学习
2026-01-28 v3 计算与语言
摘要
由大语言模型驱动的自主智能体在包括移动设备控制在内的各个领域的辅助任务中展现出有前景的潜力。由于这些智能体直接与个人信息和设备设置交互,确保其安全可靠的行为对于防止不良后果至关重要。然而,目前尚无用于标准化评估移动设备控制智能体安全性的基准。在这项工作中,我们引入了MobileSafetyBench,这是一个旨在基于Android模拟器的真实移动环境中评估设备控制智能体安全性的基准。我们开发了一系列多样化的任务,涉及与各种移动应用程序(包括消息和银行应用程序)的交互,挑战智能体管理包括误用和负面副作用在内的风险。这些任务包括评估智能体在日常场景中安全性的测试,以及它们对间接提示注入攻击的鲁棒性测试。我们的实验表明,基于最先进LLM的基线智能体在执行任务时往往无法有效防止伤害。为减轻这些安全问题,我们提出了一种提示方法,鼓励智能体优先考虑安全性。虽然这种方法在促进更安全行为方面显示出前景,但要完全赢得用户信任仍有相当大的改进空间。这凸显了持续研究的迫切需要,以在移动环境中开发更稳健的安全机制。
引用
@article{arxiv.2410.17520,
title = {MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control},
author = {Juyong Lee and Dongyoon Hahm and June Suk Choi and W. Bradley Knox and Kimin Lee},
journal= {arXiv preprint arXiv:2410.17520},
year = {2026}
}