中文

AnatomiX:面向胸片解读的解剖感知 grounded 多模态大语言模型

计算机视觉与模式识别 2026-05-26 v3 人工智能 机器学习

摘要

多模态医学大型语言模型在胸片解读方面取得了显著进展,但仍面临空间推理和解剖理解的挑战。虽然现有的grounding技术提高了整体性能,但往往无法建立真正的解剖对应关系,导致医学领域中的错误解剖理解。为弥合这一差距,我们引入了AnatomiX,一个用于解剖感知的胸片解读多任务多模态大语言模型。灵感来自放射科工作流程,AnatomiX采用两阶段方法:首先,识别解剖结构并提取其特征;其次,利用大型语言模型执行各种下游任务,如短语 grounding、报告生成、视觉问答和图像理解。广泛的实验表明,AnatomiX在解剖推理方面取得优异成绩, 在解剖grounding、短语grounding、grounded诊断和grounded描述等任务上相较于现有方法实现了25%以上的性能提升。代码和预训练模型已公开于https://aneesurhashmi.github.io/anatomix。

关键词

引用

@article{arxiv.2601.03191,
  title  = {AnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation},
  author = {Anees Ur Rehman Hashmi and Numan Saeed and Christoph Lippert},
  journal= {arXiv preprint arXiv:2601.03191},
  year   = {2026}
}