中文

Patho-AgenticRAG:基于强化学习的病理视觉语言模型多模态代理检索增强生成

计算机视觉与模式识别 2026-03-24 v2

摘要

虽然视觉语言模型(VLM)在医学影像方面表现出强大的泛化能力,但病理学呈现独特挑战,包括超高分辨率、复杂组织结构以及细微的临床语义。这些因素使病理VLM容易产生幻觉,即生成与视觉证据不一致的输出,从而削弱临床信任。现有方法在该领域的RAG方法主要依赖文本知识库,限制了其利用诊断视觉线索的能力。为此,我们提出Patho-AgenticRAG,一种基于页面级嵌入的权威病理教科书构建的数据库的多模态RAG框架。不同于传统文本唯一检索系统,它支持联合文本-图像检索,使能够直接检索同时包含所查询文本和相关视觉线索的教科书页面,从而避免关键图像信息的丢失。Patho-AgenticRAG还支持推理、任务分解和多轮检索交互,在复杂诊断场景中提高准确性。实验表明,Patho-AgenticRAG在诸如多选项诊断和视觉问答等复杂病理任务中显著优于现有多模态模型。我们的项目可在Patho-AgenticRAG存储库上获取:https://github.com/Wenchuan-Zhang/Patho-AgenticRAG。

关键词

引用

@article{arxiv.2508.02258,
  title  = {Patho-AgenticRAG: Towards Multimodal Agentic Retrieval-Augmented Generation for Pathology VLMs via Reinforcement Learning},
  author = {Wenchuan Zhang and Jingru Guo and Hengzhe Zhang and Penghao Zhang and Jie Chen and Shuwan Zhang and Zhang Zhang and Yuhao Yi and Hong Bu},
  journal= {arXiv preprint arXiv:2508.02258},
  year   = {2026}
}