UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics
机器学习
2026-04-06 v1 人工智能
摘要
扩大通用 GUI 智能体的学习受限于昂贵人类演示和合成教师监督的“蒸馏天花板”。为超越这些限制,我们提出了 UI-Oceanus 框架,通过 ground-truth 环境反馈将学习重点从模仿高层轨迹转向掌握交互物理。通过系统性地研究自监督目标,我们发现前向动力学(即未来界面状态的生成性预测)是可扩展性的主要驱动力,显著优于逆向推理。UI-Oceanus 通过将低成本自主探索(由系统执行验证)转换为高密度生成性监督,构建健壮的内部世界模型。实验评估显示,我们的方法在离线基准测试中优于非 CPT 基线,平均成功率提升 7%,在真实在线导航中提升 16.8%。此外,我们观察到导航性能随合成数据volume而扩展。这些结果表明,基于前向预测建模为可扩展的 GUI 自动化提供了更佳路径,具有稳健的跨域适应性和组合化推理能力。
引用
@article{arxiv.2604.02345,
title = {UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics},
author = {Mengzhou Wu and Yuzhe Guo and Yuan Cao and Haochuan Lu and Songhe Zhu and Pingzhe Qu and Xin Chen and Kang Qin and Zhongpu Wang and Xiaode Zhang and Xinyi Wang and Wei Dai and Gang Cao and Yuetang Deng and Zhi Gong and Dezhi Ran and Linyi Li and Wei Yang and Tao Xie},
journal= {arXiv preprint arXiv:2604.02345},
year = {2026}
}