PathVG:面向病理学视觉定位的新基准与数据集
计算机视觉与模式识别
2025-03-03 v1
摘要
随着计算病理学的快速发展,出现了许多 AI 辅助诊断任务。细胞核分割可以为下游分析分割出各种类型的细胞,但它依赖于预定义的类别且缺乏灵活性。此外,病理学视觉问答能够进行图像级理解,但缺乏区域级检测能力。为了解决这个问题,我们提出了一个名为病理学视觉定位的新基准,旨在根据不同属性的表达式检测区域。为了评估 PathVG,我们创建了一个名为 RefPath 的新数据集,其中包含 27,610 张图像和 33,500 个语言定位框。与其他领域的视觉定位相比,PathVG 呈现多尺度的病理图像,并包含具有病理学知识的表达式。在实验研究中,我们发现最大的挑战是病理表达式中隐含的隐式信息。基于此,我们提出了病理学知识增强网络(PKNet)作为 PathVG 的基线模型。PKNet 利用大语言模型(LLM)的知识增强能力,将具有隐式信息的病理术语转换为显式视觉特征,并通过设计的知识融合模块(KFM)将知识特征与表达式特征进行融合。所提出的方法在 PathVG 基准上取得了 SOTA 性能。
引用
@article{arxiv.2502.20869,
title = {PathVG: A New Benchmark and Dataset for Pathology Visual Grounding},
author = {Chunlin Zhong and Shuang Hao and Junhua Wu and Xiaona Chang and Jiwei Jiang and Xiu Nie and He Tang and Xiang Bai},
journal= {arXiv preprint arXiv:2502.20869},
year = {2025}
}
备注
10pages, 4figures