WEPO:面向基于大语言模型的网页导航的网页元素偏好优化
计算与语言
2024-12-17 v1
摘要
自动化网页导航的快速发展显著受益于将预训练的大型语言模型(LLM)作为智能体进行 grounding。然而,当前研究尚未充分利用HTML元素冗余性进行对比训练。本文提出了一种新方法,用于LLM-based网页导航任务,称为Web Element Preference Optimization (WEPO)。WEPO利用基于距离的非显著网页元素作为负样本进行无监督偏好学习,在Direct Preference Optimization (DPO)框架内优化最大似然目标。我们在Mind2Web基准测试上评估了WEPO,并经验性地表明WEPO能够更有效地将用户的高层意图与输出动作对齐。结果表明,我们的方法相较于WebAgent提升了13.8%,相较于视觉语言模型CogAgent基线提升了5.3%。我们的发现凸显了偏好优化在提升网页导航及其他网页页面任务方面的潜力,为未来研究指明了前景方向。
引用
@article{arxiv.2412.10742,
title = {WEPO: Web Element Preference Optimization for LLM-based Web Navigation},
author = {Jiarun Liu and Jia Hao and Chunhong Zhang and Zheng Hu},
journal= {arXiv preprint arXiv:2412.10742},
year = {2024}
}
备注
Published at AAAI 2025