中文

SafeMobile:面向多模态移动智能体的链级越狱检测与自动评估

人工智能 2025-07-02 v1 密码学与安全

摘要

随着多模态基础模型在智能体系统中的广泛应用,移动设备控制、智能助理交互以及多模态任务执行等场景正逐渐依赖由大型语言模型驱动的智能体。然而,这些系统也日益暴露于潜在越狱风险。攻击者可能通过特定输入诱导智能体绕过原有行为约束,进而触发某些风险和敏感操作,如修改设置、执行未授权命令或冒充用户身份,这对系统安全构成新挑战。现有针对智能体的安全措施在应对复杂交互时仍有局限,尤其是在检测多轮对话或任务序列中潜在风险行为方面。此外,目前缺乏有效且一致的自动化方法来辅助评估和确定此类风险的影响。本文探讨了移动多模态智能体的安全问题,尝试通过纳入行为序列信息来构建风险判别机制,设计了基于大型语言模型的自动化评估方案。通过在几个典型高风险任务上的初步验证,结果表明该方法在一定程度上提升了风险行为的识别能力,帮助降低智能体被越狱的概率。我们希望本研究为多模态智能体系统的安全风险建模与保护提供有价值的参考。

关键词

引用

@article{arxiv.2507.00841,
  title  = {SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents},
  author = {Siyuan Liang and Tianmeng Fang and Zhe Liu and Aishan Liu and Yan Xiao and Jinyuan He and Ee-Chien Chang and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2507.00841},
  year   = {2025}
}

备注

12 pages