SafeGround:通过不确定性校准识别 GUI 基准模型可信任的时机
人工智能
2026-02-04 v2 软件工程
摘要
图形用户界面 (GUI) 基准旨在将自然语言指令翻译为可执行的屏幕坐标,从而实现自动化 GUI 交互。然而,错误的基准会导致成本高昂且难以撤销的动作(如错误的支付批准),引发对模型可靠性的担忧。本文介绍 SafeGround,一个面向 GUI 基准模型的不确定性感知框架,通过校准实现风险感知预测。SafeGround 利用分布感知的不确定性量化方法捕捉来自模型给定输出的随机样本的空间离散程度。随后,通过校准过程,SafeGround 推导出具有统计学保障的假发现率 (FDR) 控制的测试时间决策阈值。我们在针对挑战性 ScreenSpot-Pro 数据集的多个 GUI 基准模型上应用 SafeGround。实验结果表明,我们的不确定性度量在区分正确与错误预测方面 consistently 优于现有基线,而校准后的阈值可可靠实现严格的风险控制并潜在显著提升系统层面的准确率。在多个 GUI 基准模型中,SafeGround 的系统层面准确率相较于仅使用 Gemini 推理提升了最高可达 5.38 个百分点。
引用
@article{arxiv.2602.02419,
title = {SafeGround: Know When to Trust GUI Grounding Models via Uncertainty Calibration},
author = {Qingni Wang and Yue Fan and Xin Eric Wang},
journal= {arXiv preprint arXiv:2602.02419},
year = {2026}
}