GUI-Perturbed:域随机化揭示 GUI 对齐模型中的系统性脆弱性
机器学习
2026-04-17 v1 人工智能
摘要
GUI 对齐模型在标准基准上报告超过 85% 的准确率,但在指令需要空间推理而非直接元素命名时准确率下降 27-56 个百分点。当前基准因只对每个屏幕截图一次性使用单个固定指令进行评估而遗漏了这一问题。我们提出了 GUI-Perturbed—a 一个受控扰动框架,独立变化视觉场景和指令,以衡量对齐鲁棒性。我们评估了来自同一架构血统中的三个 7B 模型,发现关系指令导致所有模型出现系统性准确率崩溃,70% 浏览器缩放导致统计显著退化,rank-8 LoRA 微调加上增强数据反而使性能下降。通过在独立轴上进行扰动,GUI-Perturbed 揭示了哪些具体能力轴受到影响——空间推理、视觉鲁棒性、推理校准——为诊断信号提供了信息,传统聚合基准无法提供此类信号。我们发布了数据集、增强管道以及一个微调模型。
引用
@article{arxiv.2604.14262,
title = {GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models},
author = {Yangyue Wang and Harshvardhan Sikka and Yash Mathur and Tony Zhou and Jinu Nyachhyon and Pranav Guruprasad},
journal= {arXiv preprint arXiv:2604.14262},
year = {2026}
}
备注
26 Pages, 17 Figures, 9 Tables