解剖结构感知的条件图文检索
计算机视觉与模式识别
2025-03-11 v1
摘要
图文检索在医疗保健领域有广泛应用,通过在给定查询图像和/或报告时自动从数据库中检索相关患者病例,辅助临床医生和放射科医生进行更高效的临床诊断与治疗,尤其是针对罕见疾病。然而,传统的 ITR 系统通常仅依赖全局图像或文本表示来衡量患者图像/报告的相似度,忽略了患者病例间的局部差异性。这通常导致检索性能欠佳。本文提出了解剖位置条件图文检索框架,该框架在给定查询图像及关联的可疑解剖区域时,旨在检索在同一解剖区域表现出相同疾病或症状的相似患者病例。为执行位置条件多模态检索,我们学习了一个医学相关性-区域对齐视觉语言模型,通过语义全局级和区域/词级对齐,生成具有泛化性且对齐良好的多模态表示。此外,我们执行位置条件对比学习,进一步利用跨对区域级对比性以提升多模态检索性能。我们表明,所提出的 RRA-VL 在阶段定位任务中达到了 SOTA 的定位性能,并在有无位置条件下均取得了令人满意的多模态检索性能。最后,我们全面研究了所提出的 ALC-ITR 系统的泛化能力和可解释性,该系统在给定检索到的患者病例(以解剖区域为条件)时,借助现成的 LLM 提示提供解释和初步诊断报告。
引用
@article{arxiv.2503.07456,
title = {Anatomy-Aware Conditional Image-Text Retrieval},
author = {Meng Zheng and Jiajin Zhang and Benjamin Planche and Zhongpai Gao and Terrence Chen and Ziyan Wu},
journal= {arXiv preprint arXiv:2503.07456},
year = {2025}
}
备注
16 pages, 10 figures