中文

SEAL:智能体与学习环境的协同演化

计算与语言 2026-05-26 v1

摘要

大型语言模型(LLM)智能体正通过交互不断获得改进,但大多数自演化方法要么只调整策略,要么只调整学习环境。我们识别出这一结构性差距,称为"智能体-环境错位":在训练过程中,智能体的能力边界会发生变化,而提供监督的环境保持静态或仅与智能体揭露的失败情况弱关联。我们提出了 SEAL,一个面向交互式工具使用智能体的闭环共演框架。SEAL 收集在可执行验证下的策略轨迹,对失败的 rollout 进行诊断并生成逐轮失败标签,利用这些诊断作为环境侧适应和模型侧策略优化的共享信号。环境通过暴露更清晰的工具 affordance 线索、约束信息和恢复导向反馈来演化其训练时学习界面,而策略则使用诊断引导的优势重新加权进行更新。在跨分布式和超出分布式的多轮工具使用评估中,大量实验表明,SEAL 在低资源智能体学习中表现出色:仅使用 400 个训练样本,即可在三个 backbone 上实现 +8.25 到 +26.25 的平均得分提升,并表现出积极的超出分布式迁移。这一结果表明,同时调整学习者及其训练时学习基底对于构建鲁棒的自我改进 LLM 智能体具有重要价值。

关键词

引用

@article{arxiv.2605.24426,
  title  = {SEAL: Synergistic Co-Evolution of Agents and Learning Environments},
  author = {Yihao Hu and Zhihao Wen and Xiujin Liu and Pan Wang and Xin Zhang and Wei Wu},
  journal= {arXiv preprint arXiv:2605.24426},
  year   = {2026}
}