PA-LLaVA:用于人类病理图像理解的大语言-视觉助手
人工智能
2024-08-20 v1
摘要
以往的人类病理图像理解进展主要涉及针对特定任务开发模型。近期研究表明,大型视觉语言模型可提升医学图像理解中各种下游任务的性能。本文开发了用于病理图像理解的领域特定大型语言-视觉助手(PA-LLaVA)。具体而言,我们(1)首先通过清理公共医学图像-文本数据构建人类病理图像-文本数据集,以实现领域特定对齐;(2)利用所提出的图像-文本数据,我们首先训练病理语言-图像预训练(PLIP)模型作为病理图像的专用视觉编码器,然后开发规模不变连接器以避免图像缩放导致的信息损失;(3)我们采用两阶段学习来训练PA-LLaVA,第一阶段进行领域对齐,第二阶段进行端到端视觉问答(VQA)任务。在实验中,我们在监督和零样本VQA数据集上评估了PA-LLaVA,模型在规模相似的多模态模型中实现了最佳整体性能。消融实验也确认了我们设计的有效性。我们认为本文提出的PA-LLaVA模型及呈现的数据集可推动计算病理学领域的研究。所有代码均可在:https://github.com/ddw2AIGROUP2CQUPT/PA-LLaVA 获取。
引用
@article{arxiv.2408.09530,
title = {PA-LLaVA: A Large Language-Vision Assistant for Human Pathology Image Understanding},
author = {Dawei Dai and Yuanhui Zhang and Long Xu and Qianlan Yang and Xiaojing Shen and Shuyin Xia and Guoyin Wang},
journal= {arXiv preprint arXiv:2408.09530},
year = {2024}
}
备注
8 pages, 4 figs