中文

面向人类病理学的基础多模态视觉语言AI助手

计算机视觉与模式识别 2023-12-14 v1 人工智能

摘要

计算病理学领域在任务特异性预测模型和任务无关的自监督视觉编码器的发展方面取得了显著进展。然而,尽管生成式人工智能(AI)呈爆炸式增长,但针对病理学定制的通用多模态AI助手的研究仍然有限。在此,我们提出了PathChat,一个用于人类病理学的视觉语言通用AI助手,它使用了一个内部开发的基础视觉编码器,该编码器在来自超过100,000个患者病例的1亿张组织学图像和118万个病理图像-标题对上进行了预训练。然后将该视觉编码器与一个预训练的大语言模型相结合,并在超过250,000条多样化的、与疾病无关的视觉语言指令上对整个系统进行微调。我们将PathChat与多个多模态视觉语言AI助手以及GPT4V(为商用多模态通用AI助手ChatGPT-4提供支持)进行了比较。当提供相关的临床背景信息与组织学图像时,PathChat在基于公开可用的、具有不同组织来源和疾病模型的病例的多项选择题上达到了87%的诊断准确率。此外,通过使用开放式问题和人类专家评估,我们发现PathChat总体上对与病理学相关的多样化查询产生了更准确且病理学家更偏好的回答。作为一个交互式、通用的视觉语言AI助手,能够灵活处理视觉和自然语言输入,PathChat有潜力在病理学教育、研究以及人机协同临床决策中找到有影响力的应用。

关键词

引用

@article{arxiv.2312.07814,
  title  = {A Foundational Multimodal Vision Language AI Assistant for Human Pathology},
  author = {Ming Y. Lu and Bowen Chen and Drew F. K. Williamson and Richard J. Chen and Kenji Ikamura and Georg Gerber and Ivy Liang and Long Phi Le and Tong Ding and Anil V Parwani and Faisal Mahmood},
  journal= {arXiv preprint arXiv:2312.07814},
  year   = {2023}
}