从交互到影响:通过理解与评估移动 UI 操作影响实现更安全的 AI 代理
人机交互
2025-03-25 v2
摘要
随着生成式 AI 的发展,越来越多的工作致力于创建能够通过操作用户界面 (UI) 来管理日常任务的自主代理。虽然先前的研究已探讨了 AI 代理如何导航 UI 以及理解 UI 结构的机制,但关于代理及其自主行为——尤其是可能具有风险或不可逆的行为——的影响仍有不足的探索。本文我们研究了由 AI 代理执行移动 UI 操作所产生的真实世界影响及其后果。我们首先通过与领域专家举办的一系列研讨会,开发了移动 UI 操作影响的分类体系。随后,我们进行了数据综合研究,以收集用户感知为具有影响力的真实移动 UI 屏幕轨迹和操作数据。我们随后利用所构建的影响分类,对收集的数据以及来自现有移动 UI 导航数据集的再利用数据进行标注。我们对不同大型语言模型 (LLM) 和其变体进行的定量评估,展示了这些模型在理解 AI 代理可能执行的移动 UI 操作影响方面的能力。我们表明,我们的分类体系能够增强这些 LLM 理解移动 UI 操作影响的推理能力,但我们的发现也揭示了其在可靠分类更细致或复杂影响类别方面存在显著差距。
引用
@article{arxiv.2410.09006,
title = {From Interaction to Impact: Towards Safer AI Agents Through Understanding and Evaluating Mobile UI Operation Impacts},
author = {Zhuohao Jerry Zhang and Eldon Schoop and Jeffrey Nichols and Anuj Mahajan and Amanda Swearngin},
journal= {arXiv preprint arXiv:2410.09006},
year = {2025}
}