Doc-Researcher:一个统一的多模态文档解析与深度研究系统
信息检索
2025-10-27 v1 计算与语言
摘要
深度研究系统彻底改变了大型语言模型通过迭代推理和证据收集解决复杂问题的方式。然而,当前的系统从根本上仍然局限于文本网络数据,忽视了嵌入在多模态文档中的海量知识。处理此类文档需要复杂的解析以保留视觉语义(图形、表格、图表和方程)、智能分块以保持结构连贯性,以及跨模态的自适应检索,而这些能力是现有系统所缺乏的。为此,我们提出了 Doc-Researcher,一个统一的系统,通过三个集成组件弥合了这一差距:(i) 深度多模态解析,保留布局结构和视觉语义,同时创建从块到文档级别的多粒度表示;(ii) 支持纯文本、纯视觉和混合范式的系统性检索架构,具有动态粒度选择;(iii) 迭代式多智能体工作流,分解复杂查询,逐步积累证据,并跨文档和模态综合全面的答案。为了进行严格的评估,我们引入了 M4DocBench,这是第一个用于多模态、多跳、多文档和多轮深度研究的基准。M4DocBench 包含 158 个专家注释的问题,跨越 304 个文档的完整证据链,测试了现有基准无法评估的能力。实验表明,Doc-Researcher 达到了 50.6% 的准确率,比最先进的基线好 3.4 倍,验证了有效的文档研究不仅需要更好的检索,更需要从根本上进行深度解析,以保持多模态完整性并支持迭代研究。我们的工作为在多模态文档集合上进行深度研究建立了一个新的范式。
引用
@article{arxiv.2510.21603,
title = {Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research},
author = {Kuicai Dong and Shurui Huang and Fangda Ye and Wei Han and Zhi Zhang and Dexun Li and Wenjun Li and Qu Yang and Gang Wang and Yichao Wang and Chen Zhang and Yong Liu},
journal= {arXiv preprint arXiv:2510.21603},
year = {2025}
}
备注
preprint