中文

用于智能体训练的推理模型环境模拟

人工智能 2025-11-04 v1 机器学习

摘要

LLM 智能体在需要深度推理的紧凑环境中表现出色,但在需要跨多样化工具和模式鲁棒性的更广泛复杂情境中仍显脆弱。为训练构建定制环境笨重、脆弱且限制进展。在本文中,我们展示了 LLM 能在无需实际测试数据或 API 的情况下模拟逼真的环境反馈。借此启发,我们提出了两个框架:Simia-SFT,通过放大小种子集以无环境依赖的方式生成样本数据,以及 Simia-RL,使无需真实环境实现即可进行 RL 训练。对开放模型进行微调可在多个基准测试中实现持续的改进,超过 GPT-4o,接近 o4-mini 在 τ2\tau^2-Bench。Simia-SFT 和 Simia-RL 使智能体训练能够无需环境工程,取代笨重且脆弱的实现,采用灵活的 LLM 基于仿真。

关键词

引用

@article{arxiv.2511.01824,
  title  = {Simulating Environments with Reasoning Models for Agent Training},
  author = {Yuetai Li and Huseyin A Inan and Xiang Yue and Wei-Ning Chen and Lukas Wutschitz and Janardhan Kulkarni and Radha Poovendran and Robert Sim and Saravan Rajmohan},
  journal= {arXiv preprint arXiv:2511.01824},
  year   = {2025}
}