Infogent:面向网页信息聚合的基于智能体的框架
人工智能
2024-10-28 v1 计算与语言
摘要
尽管许多现有的 web agent 在任务完成基准测试中表现出色,但大多数方法都是基于假设:web navigation 任务由一序列线性动作组成,末状态标志着任务完成。相反,我们的工作聚焦于用于信息聚合的网页导航,即智能体必须探索不同网站以gather complex query 所需的信息。我们从两个不同的视角考察网页信息聚合:(i) 直接 API 驱动访问依赖于纯文本视图的 Web,利用诸如 Google Search API 等外部工具来导航 Web,并使用爬虫提取网站内容。(ii) 交互式视觉访问使用网页截图,并需要与浏览器交互以导航和访问信息。针对这些多样化的信息获取场景,我们引入 Infogent,这是一个面向网页信息聚合的新型模块化框架,涉及三个 distinct 组件:Navigator、Extractor 与 Aggregator。在不同信息获取设置上的实验表明,Infogent 在 Direct API-Driven Access 下的 FRAMES 上比现有的 SOTA 多智能体搜索框架高出 7%,在 Interactive Visual Access 下的 AssistantBench 上也比现有的信息寻求 web agent 提高 4.3%。
引用
@article{arxiv.2410.19054,
title = {Infogent: An Agent-Based Framework for Web Information Aggregation},
author = {Revanth Gangi Reddy and Sagnik Mukherjee and Jeonghwan Kim and Zhenhailong Wang and Dilek Hakkani-Tur and Heng Ji},
journal= {arXiv preprint arXiv:2410.19054},
year = {2024}
}
备注
Preprint