中文

基于代码的逆自训练框架 CORE 结合图扩张构建虚拟智能体

机器学习 2026-01-06 v1 计算机视觉与模式识别

摘要

虽然通过集成多模态大语言模型,多模态虚拟智能体的开发取得了显著进展,但主流训练范式面临关键挑战:行为克隆通过模仿实现简单且有效,但存在行为多样性低的问题;而强化学习能够通过探索发现新策略,但高度依赖人工设计的奖励函数。为解决这两种方法之间的冲突,我们提出 CORE,即基于代码的逆自训练框架,结合图扩张,搭建连接模仿与探索的框架,提供一种促进行为多样性同时消除对人工奖励设计依赖的新型训练框架。具体而言,我们引入语义代码抽象,从 expert 演示自动推断奖励函数,而无需人工设计。推断得到的奖励函数称为标签函数,是可执行代码,用于验证任务中的一个关键步骤。基于此,我们提出策略图扩张,以增强领域内行为的多样性,构建捕获 expert 演示之外的多种有效解决方案的多路径图,即策略图。进一步,我们引入轨迹引导的外推,通过利用成功和失败的轨迹来扩充任务空间,从而丰富跨域行为的多样性。在 Web 和 Android 平台上的实验表明,CORE 在整体性能和泛化能力方面均显著提升,凸显其作为构建强大虚拟智能体的稳健且通用训练范式的潜力。

关键词

引用

@article{arxiv.2601.02201,
  title  = {CORE: Code-based Inverse Self-Training Framework with Graph Expansion for Virtual Agents},
  author = {Keyu Wang and Bingchen Miao and Wendong Bu and Yu Wu and Juncheng Li and Shengyu Zhang and Wenqiao Zhang and Siliang Tang and Jun Xiao and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2601.02201},
  year   = {2026}
}

备注

19 pages, 12 figures