中文

WSI-VQA: 基于生成式视觉问答的全切片图像解释

计算机视觉与模式识别 2024-07-09 v1 人工智能

摘要

全切片成像在肝癌诊断和预后评估中被广泛采用。由于全切片图像(WSI)的巨大尺寸和异构特征,病理学家若要获得准确可靠的诊断结果,需要大量的经验。本文提出了一种新颖的框架(WSI-VQA),通过生成式视觉问答来解释WSI。WSI-VQA通过将各种切片级任务重新构建为问答模式,展现出其通用性,病理学家可在人机交互后实现免疫组织化学分层、生存预测和肿瘤亚型鉴别。此外,我们建立了一个WSI-VQA数据集,包含8672个切片级问答对,涉及977个WSI。除了能够处理不同切片级任务外,我们提出的名为Wsi2Text Transformer(W2T)的生成模型相较于现有的判别模型在医学正确性方面表现更优,揭示了该模型在临床场景中应用的潜力。我们还对词嵌入与WSI之间的注意力映射进行可视化,以作为诊断结果的直观解释。数据集和相关代码已公开于https://github.com/cpystan/WSI-VQA。

关键词

引用

@article{arxiv.2407.05603,
  title  = {WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering},
  author = {Pingyi Chen and Chenglu Zhu and Sunyi Zheng and Honglin Li and Lin Yang},
  journal= {arXiv preprint arXiv:2407.05603},
  year   = {2024}
}

备注

Accepted at ECCV 2024