WILBUR:用于鲁棒且准确的Web代理的自适应上下文学习
计算与语言
2024-04-10 v1 人工智能
摘要
在Web代理研究领域,实现泛化能力和准确性仍然是一个具有挑战性的问题。由于网站结构的高方差,现有方法经常失败。此外,现有的微调和上下文学习技术无法在多个网站之间泛化。我们引入了Wilbur,这是一种使用可微排序模型和新颖的指令合成技术,用先前运行的任务演示最优地填充黑盒大型语言模型提示的方法。为了最大化端到端成功率,我们还提出了一种智能回溯机制,该机制能够学习并从其错误中恢复。最后,我们表明我们的排序模型可以在来自生成式自动课程的数据上进行训练,该课程从LLM中采样代表性目标,运行代理,并自动评估它,无需人工标注。Wilbur在WebVoyager基准测试上取得了最先进的结果,总体上比纯文本模型高出8%,在某些网站上高达36%。在同一基准测试中,尽管仅接收文本输入,Wilbur与强大的多模态模型的差距在5%以内,进一步分析表明大量失败是由于操作Web的工程挑战所致。
引用
@article{arxiv.2404.05902,
title = {WILBUR: Adaptive In-Context Learning for Robust and Accurate Web Agents},
author = {Michael Lutz and Arth Bohra and Manvel Saroyan and Artem Harutyunyan and Giovanni Campagna},
journal= {arXiv preprint arXiv:2404.05902},
year = {2024}
}