中文

Multimodal DeepResearcher:基于智能体框架从零生成文本-图表交错报告

计算与语言 2025-12-16 v3 人工智能

摘要

可视化在概念和信息的有效沟通中发挥着至关重要的作用。近期在推理和检索增强生成方面的进展使得大型语言模型能够进行深度研究并生成详尽的报告。尽管取得了进展,现有的深度研究框架主要侧重于生成纯文本内容,对文本与可视化交错的自动生成探索不足。这一新颖任务在设计信息丰富的可视化并将其与文本报告有效整合方面带来了关键挑战。为应对这些挑战,我们提出了形式化可视化描述,一种图表的结构化文本表示,使 LLM 能够学习并生成多样、高质量的可视化。在此表示的基础上,我们引入了 Multimodal DeepResearcher,一种智能体框架,将任务分解为四个阶段:(1) 研究,(2) 示例报告文本化,(3) 规划,(4) 多模态报告生成。为评估生成的多模态报告,我们开发了 MultimodalReportBench,其中包含 100 个作为输入的多样化主题以及 5 个专用指标。跨模型和评估方法的大量实验证明了 Multimodal DeepResearcher 的有效性。值得注意的是,在使用相同的 Claude 3.7 Sonnet 模型下,Multimodal DeepResearcher 相对基线方法实现了 82% 的总体胜率。

关键词

引用

@article{arxiv.2506.02454,
  title  = {Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework},
  author = {Zhaorui Yang and Bo Pan and Han Wang and Yiyao Wang and Xingyu Liu and Luoxuan Weng and Yingchaojie Feng and Haozhe Feng and Minfeng Zhu and Bo Zhang and Wei Chen},
  journal= {arXiv preprint arXiv:2506.02454},
  year   = {2025}
}

备注

AAAI 2026 Oral