Quilt-LLaVA:通过从开源组织病理学视频中提取局部化叙述进行视觉指令微调
计算机视觉与模式识别
2025-01-14 v3 人工智能
计算与语言
摘要
组织病理学诊断需要对整个全切片图像(WSI)进行全局分析,要求病理学家综合来自不同 WSI 图像块的证据。WSI 的十亿像素级尺度对组织病理学多模态模型构成了挑战。训练组织病理学多模态模型需要指令微调数据集,而当前的数据集仅包含单个图像块的信息,既缺乏每个图像块内概念的空间定位,也缺乏对 WSI 的更广阔视野。因此,它们缺乏足够的组织病理学诊断能力。为了弥合这一差距,我们引入了 Quilt-Instruct,这是一个大规模数据集,包含 107,131 个组织病理学特定的指令问答对,这些问答对基于构成 WSI 的诊断相关图像块。我们的数据集通过利用 YouTube 上的教育性组织病理学视频收集,通过自动提取讲解者的光标位置来提供叙述的空间定位。Quilt-Instruct 通过从整个 WSI 中提取诊断和支持事实来支持上下文推理。利用 Quilt-Instruct,我们训练了 Quilt-LLaVA,它能够超越给定的单个图像块进行推理,从而实现跨图像块的诊断推理。为了评估 Quilt-LLaVA,我们提出了一个由 985 张图像和 1283 个人工生成的问答组成的综合评估数据集。我们还使用公开的组织病理学数据集对 Quilt-LLaVA 进行了全面评估,其中 Quilt-LLaVA 在相对 GPT-4 分数上显著优于 SOTA 超过 10%,在开放集和封闭集 VQA 上分别超过 4% 和 9%。我们的代码、数据和模型可在 quilt-llava.github.io 公开获取。
引用
@article{arxiv.2312.04746,
title = {Quilt-LLaVA: Visual Instruction Tuning by Extracting Localized Narratives from Open-Source Histopathology Videos},
author = {Mehmet Saygin Seyfioglu and Wisdom O. Ikezogwo and Fatemeh Ghezloo and Ranjay Krishna and Linda Shapiro},
journal= {arXiv preprint arXiv:2312.04746},
year = {2025}
}