中文

揭示语言模型智能体在网页顺序任务组合上的局限性

机器学习 2025-01-03 v3 人工智能 计算与语言

摘要

语言模型智能体(LMA)近来作为一种在多变决策任务上有前景的范式出现,常超越人类及其他强化学习智能体。尽管前景可期,但其在现实应用中常涉及任务组合时的表现仍待充分探索。本工作中,我们引入一个名为 CompWoB 的新基准——50 项反映更现实假设的组合式网页自动化任务。我们表明,尽管现有的提示型 LMA(gpt-3.5-turbo 或 gpt-4)在基础任务上达到 94.0% 的平均成功率,其在组合任务上的性能降至 24.9% 成功率。另一方面,迁移型 LMA(仅在基础任务上微调)表现出较小的泛化差距,从 85.4% 降至 54.8%。通过平衡跨任务的数据分布,我们训练了一个新模型 HTML-T5++,在 MiniWoB 上超越人类水平性能(95.2%),并在 CompWoB 上取得最佳零样本性能(61.5%)。尽管这些凸显了小规模微调与迁移模型在任务组合性上的前景,其性能在不同指令组合改变组合顺序时进一步退化。与近期 LMA 的显著成功相反,我们的基准与细致分析强调了构建对任务组合性鲁棒且可泛化的 LMA 以用于现实部署的必要性。

关键词

引用

@article{arxiv.2311.18751,
  title  = {Exposing Limitations of Language Model Agents in Sequential-Task Compositions on the Web},
  author = {Hiroki Furuta and Yutaka Matsuo and Aleksandra Faust and Izzeddin Gur},
  journal= {arXiv preprint arXiv:2311.18751},
  year   = {2025}
}

备注

Published at Transactions on Machine Learning Research (TMLR), Code: https://github.com/google-research/google-research/tree/master/compositional_rl/compwob