AI 搜索的模型-文档协议
计算与语言
2025-10-31 v2 人工智能
信息检索
摘要
AI 搜索依赖于将大型语言模型 (LLM) 与广泛的外部知识源相链接。然而,网页、PDF 文件等原始文档并非天然适合 LLM 使用:它们长度不定、噪声较大且缺乏结构。传统检索方法将这些文档视为逐字文本并返回原始段落,将段落拼接和上下文推理的负担留给 LLM。这一差距凸显了需要重新定义模型与文档交互方式的新检索范式。我们提出模型-文档协议 (MDP),一种通用的框架,用于通过可供 LLM 消耗的知识表示将原始文本与 LLM 桥接。相较于将检索视为段落获取,MDP 定义了多条路径,将非结构化文档转化为特定任务的、可供 LLM 消耗的输入。这些包括代理推理,精选原始证据以形成连贯的上下文;记忆 grounding,将可重用的笔记累积以丰富推理;以及结构化利用,将文档编码为图或键值缓存等形式。这三条路径共享同一个目标:确保 LLM 接收到的并非原始碎片,而是直接可用于推理的紧凑、结构化的知识。作为一种实例,我们展示了 MDP-Agent,通过构建文档级 gist 记忆实现全局覆盖,进行基于扩散的探索以垂直开发揭示分层依赖,并应用 map-reduce 风格的综合将大规模证据整合为紧凑且充分的上下文。信息检索基准测试中的实验表明,MDP-Agent 在基线之上,验证了 MDP 框架的合理性以及其代理化实例的有效性。
引用
@article{arxiv.2510.25160,
title = {Model-Document Protocol for AI Search},
author = {Hongjin Qian and Zheng Liu},
journal= {arXiv preprint arXiv:2510.25160},
year = {2025}
}
备注
10 pages