中文

CheXLearner:面向progression检测的文本引导细粒度表征学习

计算机视觉与模式识别 2025-05-13 v1

摘要

时间医学图像分析是临床决策的关键任务,但现有方法要么在粗糙层面对图像和文本进行对齐,导致潜在的语义不匹配,要么仅依赖视觉信息,缺乏医学语义的集成。我们提出了 CheXLearner,这是首个统一解剖区域检测、黎曼流形基准对齐和细粒度区域语义指导的端到端框架。我们提出的 Med-Manifold Alignment Module (Med-MAM) 利用双曲几何对解剖结构进行稳健对齐,并捕获跨时间胸腔 X 光片中具有病理意义的差异。通过引入区域progression描述作为监督,CheXLearner 实现了增强的跨模态表征学习,并支持动态低层特征优化。实验表明,CheXLearner 在解剖区域progression检测上实现了 81.12%(提升 17.2%)的平均准确率和 80.32%(提升 11.05%)的 F1 分数,显著优于现有SOTA基线,尤其在结构复杂的区域表现更佳。此外,我们的模型在下游疾病分类中达到了 91.52% 的平均 AUC 分数,验证了其卓越的特征表征能力。

关键词

引用

@article{arxiv.2505.06903,
  title  = {CheXLearner: Text-Guided Fine-Grained Representation Learning for Progression Detection},
  author = {Yuanzhuo Wang and Junwen Duan and Xinyu Li and Jianxin Wang},
  journal= {arXiv preprint arXiv:2505.06903},
  year   = {2025}
}