中文

PathGen-1.6M:通过多智能体协作生成 160 万病理图像-文本对

计算机视觉与模式识别 2024-07-02 v1

摘要

视觉语言模型(VLMs)如 CLIP 在病理学领域引起广泛关注,作为零样本图像分类和整块切片图像(WSI)分析的 backbone。此外,它们可以作为视觉编码器与大型语言模型(LLMs)组合,以支持更广泛的能力。当前致力于训练病理 VLMs 的努力依赖来自 PubMed、YouTube 和 Twitter 等平台的病理图像-文本对,这些数据有限且不可扩展,通常图像质量也不理想。本文我们利用大型 WSI 数据集如 TCGA 提取大量高质量图像块。然后我们训练一个大型多模态模型为这些图像生成描述,创建 PathGen-1.6M,包含 160 万对高质量图像-文本对。我们的方法涉及多个代理模型协作,从而从代表性 WSI 图像块中提取信息、生成和细化描述,以获得高质量的图像-文本对。广泛的实验表明,将这些生成的对与现有数据集结合用于训练病理特定 CLIP 模型(PathGen-CLIP),可显著提升其分析病理图像的能力,在九个与病理相关的零样本图像分类任务和三个整块切片图像任务中均取得显著改进。此外,我们基于 PathGen-1.6M 构建了 20 万条指令调优数据,并将 PathGen-CLIP 与 Vicuna LLM 集成,通过指令调优创建更强大的多模态模型。总体而言,我们为病理学的高质量数据生成提供了可扩展的途径,为下一代通用病理模型铺平了道路。

关键词

引用

@article{arxiv.2407.00203,
  title  = {PathGen-1.6M: 1.6 Million Pathology Image-text Pairs Generation through Multi-agent Collaboration},
  author = {Yuxuan Sun and Yunlong Zhang and Yixuan Si and Chenglu Zhu and Zhongyi Shui and Kai Zhang and Jingxiong Li and Xingheng Lyu and Tao Lin and Lin Yang},
  journal= {arXiv preprint arXiv:2407.00203},
  year   = {2024}
}

备注

13 pages, 3 figures