中文

分解疾病描述以增强病理检测:一种多视角视觉-语言预训练框架

计算机视觉与模式识别 2024-04-02 v4

摘要

医学视觉-语言预训练(VLP)已成为研究前沿,通过将查询图像与每种疾病的文本描述进行比较,实现零样本病理识别。由于生物医学文本语义复杂,当前方法难以将医学图像与非结构化报告中的关键病理发现相对齐。这导致与目标疾病文本表示的错位。在本文中,我们引入了一种新颖的 VLP 框架,旨在利用关于病理视觉表现的先验知识,将疾病描述分解为其基本方面。这是通过咨询大型语言模型和医学专家来实现的。结合 Transformer 模块,我们的方法将输入图像与疾病的各个要素对齐,生成以方面为中心的图像表示。通过整合来自每个方面的匹配结果,我们提高了图像与其相关疾病之间的兼容性。此外,利用面向方面的表示,我们提出了一种双头 Transformer,专门用于处理已知和未知疾病,优化综合检测效能。在七个下游数据集上进行的实验表明,与近期方法相比,我们将已见类别和未见类别的准确率分别提高了高达 8.56% 和 17.26%。我们的代码已在 https://github.com/HieuPhan33/MAVL 发布。

关键词

引用

@article{arxiv.2403.07636,
  title  = {Decomposing Disease Descriptions for Enhanced Pathology Detection: A Multi-Aspect Vision-Language Pre-training Framework},
  author = {Vu Minh Hieu Phan and Yutong Xie and Yuankai Qi and Lingqiao Liu and Liyang Liu and Bowen Zhang and Zhibin Liao and Qi Wu and Minh-Son To and Johan W. Verjans},
  journal= {arXiv preprint arXiv:2403.07636},
  year   = {2024}
}

备注

Accepted at CVPR2024. Pre-print before final camera-ready version