中文

基于指令微调基础模型的多模态网页导航

机器学习 2024-02-27 v4 人工智能 机器学习

摘要

自主网页导航的进展一直受限于通过在线强化学习进行数十亿次探索性交互的依赖,以及难以利用丰富域外数据泛化的特定领域模型设计。本工作中,我们研究基于视觉-语言基础模型的数据驱动离线训练用于网页智能体。我们提出一个遵循指令的多模态智能体WebGUM,其同时观察网页截图与HTML页面并输出网页导航动作,如点击与键入。WebGUM通过在大规模演示语料上联合微调一个指令微调语言模型与一个具备时序和局部感知的视觉编码器进行训练。我们经实证表明,该方法提升了智能体的具身多模态感知、HTML理解与多步推理能力,以显著优势超越先前工作。在MiniWoB上,我们相较此前最佳离线方法提升超过45.8%,甚至优于在线微调的SOTA、人类及基于GPT-4的智能体。在WebShop基准上,我们30亿参数的模型取得优于现有SOTA(PaLM-540B)的性能。此外,WebGUM在Mind2Web的真实世界规划任务上展现出强正迁移。我们还利用所训练模型收集了347K高质量演示,较先前工作大38倍,并公开以促进该方向未来研究。

关键词

引用

@article{arxiv.2305.11854,
  title  = {Multimodal Web Navigation with Instruction-Finetuned Foundation Models},
  author = {Hiroki Furuta and Kuang-Huei Lee and Ofir Nachum and Yutaka Matsuo and Aleksandra Faust and Shixiang Shane Gu and Izzeddin Gur},
  journal= {arXiv preprint arXiv:2305.11854},
  year   = {2024}
}

备注

Accepted to ICLR 2024. Website: https://sites.google.com/view/mm-webnav/