基于预训练视觉 Transformer 的组织病理学图像自动报告生成
计算机视觉与模式识别
2023-11-15 v2
摘要
组织病理学中的深度学习已成功用于疾病分类、图像分割等。然而,由于组织病理学图像的高分辨率,使用当前最先进方法结合图像与文本模态一直是个挑战。组织病理学图像的自动报告生成便是这样一项挑战。在本工作中,我们展示通过两步过程使用已有的预训练 Vision Transformer:首先用它编码全切片图像(WSI)中 4096x4096 大小的图块,然后将其作为编码器、以 LSTM 为解码器进行报告生成,从而构建出一个性能相当且可移植的报告生成机制,该机制考虑整个高分辨率图像而非仅图块。我们也能够使用来自已有强大预训练层次化视觉 Transformer 的表示,并展示其在零样本分类以及报告生成中的有用性。
引用
@article{arxiv.2311.06176,
title = {Automatic Report Generation for Histopathology images using pre-trained Vision Transformers},
author = {Saurav Sengupta and Donald E. Brown},
journal= {arXiv preprint arXiv:2311.06176},
year = {2023}
}
备注
Extended Abstract presented at Machine Learning for Health (ML4H) symposium 2023, December 10th, 2023, New Orleans, United States, 09 pages