中文

GUI-CIDER:基于因果内化与密度感知样本重选的中期训练 GUI 代理方法

计算与语言 2026-05-28 v1

摘要

尽管多模态大语言模型在构建图形用户界面 (GUI) 代理方面取得了快速进展,但其在实际任务完成方面的能力仍然受限于缺乏关于 GUI 操作的世界知识。现有方法通常依赖昂贵的多智能体框架或传统的后训练范式,如监督微调 (SFT) 和强化学习 (RL)。然而,后训练只能通过动作标注或奖励信号使代理隐式吸收世界知识,导致轨迹记忆效率低下而非真正的理解。因此,一种能够实现此知识显式学习的方法至关重要。为此,我们提出了 GUI-CIDER,这是一种中期训练方法,通过因果内化 (Causal Internalization) 和密度感知样本重选 (Density-aware Exemplar Reselection) 显式内化 GUI 世界知识。GUI-CIDER 在三个阶段中运行:(1) 数据合成,将 GUI 轨迹中的静态规划与动态因果知识蒸馏为文本;(2) 样本重选,通过奖励因果结构并惩罚语义冗余来过滤语料库;(3) 中期训练,在精炼后的数据上嵌入所获取的知识。在两个 GUI 知识基准和三个任务完成基准上的大量实验表明,GUI-CIDER 在提升代理对 GUI 操作理解和任务成功率方面 consistently 取得佳绩。代码已公开于 https://github.com/Wuzheng02/GUI-CIDER。

关键词

引用

@article{arxiv.2605.28534,
  title  = {GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection},
  author = {Zheng Wu and Chengcheng Han and Zhengxi Lu and Tianjie Ju and Yanyu Chen and Qi Gu and Xunliang Cai and Zhuosheng Zhang},
  journal= {arXiv preprint arXiv:2605.28534},
  year   = {2026}
}