K^2-Agent:用于层次化移动设备控制的共演化认知
人工智能
2026-03-03 v1
摘要
现有的移动设备控制代理在解决需要长期规划和精确操作的复杂任务时表现不佳,通常由于缺乏相关任务经验或不熟悉技能执行。我们提出 K2-Agent,一个层次化框架,通过分离和共演化声明性 (认识事物) 和程序性 (认识如何) 知识来建模类人认知,用于规划和执行。K2-Agent 的高层推理器从每个任务仅获取一个演示,并运行 Summarize-Reflect-Locate-Revise (SRLR) 循环,通过自我演化提炼和迭代细化任务级声明性知识。低层执行器采用我们基于课程引导的 Group Relative Policy Optimization (C-GRPO) 进行训练,该方法 (i) 使用解耦的奖励信号构建平衡的样本池, (ii) 采用动态演示注入引导模型自主生成成功轨迹以进行训练。在具有挑战性的 AndroidWorld 基准测试上,K2-Agent 仅使用原始屏幕截图和开源 backbone 即可实现 76.1% 的成功率。此外,K2-Agent 显示出强大的双重泛化能力:其高层声明性知识可跨越 diverse base 模型迁移,而其低层程序技能在 ScreenSpot-v2 和 Android-in-the-Wild (AitW) 中的未见任务上取得竞争性表现。
引用
@article{arxiv.2603.00676,
title = {K^2-Agent: Co-Evolving Know-What and Know-How for Hierarchical Mobile Device Control},
author = {Zhe Wu and Donglin Mo and Hongjin Lu and Junliang Xing and Jianheng Liu and Yuheng Jing and Kai Li and Kun Shao and Jianye Hao and Yuanchun Shi},
journal= {arXiv preprint arXiv:2603.00676},
year = {2026}
}