GAIA:用于训练 GUI 测试时缩放评判模型的数据飞轮系统
人工智能
2026-01-27 v1
摘要
尽管大型视觉语言模型(LVLMs)显著提升了 GUI 智能体在解析文本指令、理解屏幕内容和执行任务方面的能力,但一个关键挑战依然存在:智能体操作的不可逆性,其中单一的错误操作可能引发灾难性的偏离。为了解决这个问题,我们提出了 GUI 动作评判的数据飞轮系统(GAIA),这是一个训练框架,使模型具备迭代评判能力,用于提升基础 GUI 智能体的测试时缩放(TTS)性能。具体而言,我们首先使用来自基础智能体的正负动作样本训练了一个直觉评判模型(ICM)。该评判模型评估智能体预期动作的即时正确性,从而选择成功率更高的操作。然后,初始评判模型指导智能体动作以收集精炼的正负样本,启动自我改进的循环。增强后的数据随后训练出具有更强辨别能力的第二轮评判模型。我们在多个数据集上进行了实验,证明所提出的 ICM 能够提升各种闭源和开源模型的测试时性能,并且随着数据的循环利用,性能可以逐步提升。代码和数据集将公开发布。
引用
@article{arxiv.2601.18197,
title = {GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models},
author = {Shaokang Wang and Pei Fu and Ruoceng Zhang and Shaojie Zhang and Xiuwen Xi and Jiahui Yang and Bin Qin and Ying Huang and Zhenbo Luo and Jian Luan},
journal= {arXiv preprint arXiv:2601.18197},
year = {2026}
}