中文

Synatra:将间接知识转化为数字代理的直接演示

人工智能 2024-11-28 v2

摘要

大语言模型(LLM)现在可以作为与数字环境交互以完成特定目标(例如安排线上会议)的自主代理。然而,准确率仍远不理想,部分原因是缺乏针对数字任务的大规模直接演示。人类获取监督性数据的成本高昂,自动通过探索或强化学习获取的数据收集依赖复杂的环境和内容设置,导致数据集缺乏对各种情景的全面覆盖。另一方面,存在大量可能间接帮助完成任务的知识,例如为人类消费而创建的在线教程。本文提出了 Synatra 方法,有效地将这种间接知识转化为规模化的直接监督。我们定义了不同类型的间接知识,仔细研究可获取的来源,编码直接演示的结构,并最终将间接知识转化为直接演示。我们创建了 10 万个人工合成演示,用于微调 7B CodeLlama,结果表明,该代理在三个基于网页的任务基准测试 Mind2Web、MiniWoB++ 和 WebArena 中,超过了所有规模相当的模型,在 WebArena 和 Mind2Web 上也超过了 GPT-3.5。此外,尽管人工合成演示的成本仅为人类演示的 3%(每个仅需 0.031 美元),我们还表明,合成演示在相同数量的人类演示(收集自有限域)时,仍能更有效。

关键词

引用

@article{arxiv.2409.15637,
  title  = {Synatra: Turning Indirect Knowledge into Direct Demonstrations for Digital Agents at Scale},
  author = {Tianyue Ou and Frank F. Xu and Aman Madaan and Jiarui Liu and Robert Lo and Abishek Sridhar and Sudipta Sengupta and Dan Roth and Graham Neubig and Shuyan Zhou},
  journal= {arXiv preprint arXiv:2409.15637},
  year   = {2024}
}