中文

InSTA:面向互联网规模智能体训练

机器学习 2025-05-23 v2 人工智能

摘要

训练网页导航智能体的主要方法是收集人类对热门网站的一组人类演示和手写任务,但随着人类数据的不断使用,已显现出人类数据是一种低效资源。我们开发了一个管道,以便在无需繁琐人工标注的情况下进行互联网规模的训练。首先,LLM为15万个网站标注智能体任务。在下一阶段,LLM智能体完成这些任务并生成轨迹。在最后一阶段,LLM筛选出成功的轨迹。语言模型是强大的数据 curated tool,识别有害内容的准确率为97%,判断成功轨迹的准确率为82.6%,并产生有效的数据。我们训练的基于Qwen 3 1.7B的智能体在与前沿LLM竞争的同时保持较小规模和更快速度。我们最好的智能体达到了56.9%的成功率,超过了数据收集策略Qwen 3 235B(一个235倍大的Llama 4 Maverick),并达到Gemini 2.5 Flash性能的94.7%。我们将在https://data-for-agents.github.io发布代码、模型和数据。

关键词

引用

@article{arxiv.2502.06776,
  title  = {InSTA: Towards Internet-Scale Training For Agents},
  author = {Brandon Trabucco and Gunnar Sigurdsson and Robinson Piramuthu and Ruslan Salakhutdinov},
  journal= {arXiv preprint arXiv:2502.06776},
  year   = {2025}
}

备注

Improved results, zero-shot transfer to Web Voyager