使用预训练 Vision Transformer 与 BERT 的组织病理学图像自动报告生成
计算机视觉与模式识别
2024-03-18 v2
摘要
组织病理学的深度学习已成功用于疾病分类、图像分割等任务。然而,由于组织病理学图像的高分辨率,使用当前最先进(SOTA)方法结合图像与文本模态一直是一项挑战。组织病理学图像的自动报告生成便是此类挑战之一。在本工作中,我们表明,使用现有的预训练 Vision Transformer (ViT) 对 4096x4096 大小的全幻灯片图像 (WSI) 图块进行编码,并使用预训练的 Bidirectional Encoder Representations from Transformers (BERT) 模型作为基于语言建模的解码器来生成报告,我们可以构建一种兼顾整张高分辨率图像的高性能且可移植的报告生成机制。我们的方法不仅能生成并评估描述该图像的说明文字,还有助于将图像分类为组织类型及患者的性别。我们表现最佳的模型在组织类型分类中达到了 89.52% 的准确率,在我们的说明文字生成任务中 BLEU-4 得分为 0.12。
引用
@article{arxiv.2312.01435,
title = {Automatic Report Generation for Histopathology images using pre-trained Vision Transformers and BERT},
author = {Saurav Sengupta and Donald E. Brown},
journal= {arXiv preprint arXiv:2312.01435},
year = {2024}
}
备注
Accepted at IEEE ISBI 2024. arXiv admin note: substantial text overlap with arXiv:2311.06176