RAG-Anything:面向所有模态的统一检索增强生成框架
人工智能
2025-10-15 v1
摘要
检索增强生成(Retrieval-Augmented Generation, RAG)已成为扩展大型语言模型突破静态训练局限性的基本范式。然而,当前RAG能力与实际信息环境之间存在关键性错位。现代知识库本质上具有多模态特征,包含文本内容、视觉元素、结构化表格和数学表达式等丰富组合。然而,现有RAG框架仅限于文本内容,在处理多模态文档时存在根本性差距。我们提出RAG-Anything,一个统一框架,实现跨所有模态的全面知识检索。我们的ethods方法将多模态内容重新概念化为 interconnected knowledge entities(相互关联的知识实体),而非孤立的数据类型。该框架引入双图构建(dual-graph construction)以捕获跨模态关系和文本语义于统一表示之内。我们发展跨模态混合检索(cross-modal hybrid retrieval),结合结构化知识导航与语义匹配。这使我们能够有效地推理异构内容,其中相关证据跨越多个模态。RAG-Anything 在具有挑战性的多模态基准测试上表现优异,相较于最先进的方法实现显著提升。在长文档场景尤其显著,其中传统方法会失败。我们的框架确立了多模态知识获取的新范式,消除了当前系统受限于架构碎片化的局面。我们的框架已开源于:https://github.com/HKUDS/RAG-Anything。
引用
@article{arxiv.2510.12323,
title = {RAG-Anything: All-in-One RAG Framework},
author = {Zirui Guo and Xubin Ren and Lingrui Xu and Jiahao Zhang and Chao Huang},
journal= {arXiv preprint arXiv:2510.12323},
year = {2025}
}