CORA:面向受控移动 GUI 自动化的 conformal risk 控制代理
机器学习
2026-04-13 v1 人工智能
摘要
由视觉语言模型(VLM)驱动的图形用户界面(GUI)代理正快速从被动辅助转向自主操作。然而,这种不受限制的行动空间暴露用户面临严重且不可逆的财务、隐私或社会伤害。现有保护措施依赖于提示工程、脆弱的启发式方法以及 VLM 作为批评家缺乏形式化验证和用户可调保证。我们提出 CORA(COnformal Risk-controlled GUI Agent),一个后策略、行动前的保护框架,提供对有害执行动作的统计保证。CORA 将安全性重新表述为选择性动作执行:我们训练守护模型以估计每个提议步骤的动作条件风险。我们不对原始分数进行阈值化,而是利用 Conformal Risk Control 对执行/放弃边界进行校准,以满足用户指定的风险预算,并将被拒绝的动作路由到可训练的诊断师模型,该模型对被拒绝的动作进行多模态推理,以推荐干预措施(如确认、反思或中止),以最小化用户负担。目标锁定机制锚定评估以明确、冻结的用户意图,以抵抗视觉注入攻击。为严格评估这一范式,我们引入 Phone-Harm,一个新的移动安全违规基准,包含实际场景下的步骤级伤害标签。在 Phone-Harm 和公开基准上的实验验证了 CORA 在安全性、帮助性和中断性三者之间的 Pareto 前沿获得改进,为自主 GUI 执行提供了实用且具有统计学依据的安全范式。代码和基准可在 cora-agent.github.io 获取。
引用
@article{arxiv.2604.09155,
title = {CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation},
author = {Yushi Feng and Junye Du and Qifan Wang and Zizhan Ma and Qian Niu and Yutaka Matsuo and Long Feng and Lequan Yu},
journal= {arXiv preprint arXiv:2604.09155},
year = {2026}
}