LoFi:基于位置感知的胸部X光细粒度表征学习
计算机视觉与模式识别
2026-04-28 v2 人工智能
摘要
细粒度表征学习对于胸部X光的检索和短语定位至关重要,因为临床相关发现往往局限于特定区域。然而,基于对比学习的模型缺乏区域级监督,大型视觉语言模型在外部验证中捕获细粒度表征的能力有限,导致该类任务性能次优。为克服这些限制,我们提出一种位置感知细粒度表征学习方法(LoFi),通过联合优化 sigmoid、描述和位置感知描述损失,使用轻量级大语言模型。位置感知描述损失通过锚定和稠密描述目标实现区域级监督,从而促进细粒度表征学习。基于这些表征,我们将细粒度编码器集成到基于检索的情境学习中,以增强胸部X光在不同设置下的细粒度定位能力。广泛的实验表明,我们的方法在 MIMIC-CXR 和 PadChest-GR 上在检索和短语定位方面实现了优异性能。
引用
@article{arxiv.2603.19451,
title = {LoFi: Location-Aware Fine-Grained Representation Learning for Chest X-ray},
author = {Myeongkyun Kang and Yanting Yang and Xiaoxiao Li},
journal= {arXiv preprint arXiv:2603.19451},
year = {2026}
}