AutoS$^2$earch:解锁大模型在基于网页的源搜索中的推理潜力
人工智能
2025-03-05 v1 人机交互
摘要
基于网页的管理系统在风险控制和工业安全领域得到了广泛应用。然而,有效地将源搜索功能集成到这些系统中,以启用决策者定位和解决危险(例如气体泄漏检测)仍是一个挑战。虽然先前的努力探索了使用网络众包和人工智能算法进行源搜索决策支持,但这些方法在招募人类参与者方面存在开销,在紧急情况下响应速度较慢。为此,我们引入 AutoSearch,一个新型框架,利用大模型实现网页应用中的零样本源搜索。AutoSearch operates on a simplified visual environment projected through a web-based display, utilizing a chain-of-thought prompt designed to emulate human reasoning. 多模态大语言模型 (MLLM) 动态将视觉观察转换为语言描述,使 LLM 能够对四个方向选择进行语言推理。大量实验表明,AutoSearch 的性能几乎等同于人类-AI 协作源搜索,同时消除了对众包劳动的依赖。我们的工作为在其他工业应用中设计此类自主系统提供了有价值的见解。
引用
@article{arxiv.2502.09913,
title = {AutoS$^2$earch: Unlocking the Reasoning Potential of Large Models for Web-based Source Search},
author = {Zhengqiu Zhu and Yatai Ji and Jiaheng Huang and Yong Zhao and Sihang Qiu and Rusheng Ju},
journal= {arXiv preprint arXiv:2502.09913},
year = {2025}
}