超越掩膜:医学图像解析的理由
计算机视觉与模式识别
2026-05-13 v1
摘要
医学影像研究在过去十年中在一件事上做得非常出色:生成逐体素的掩膜。掩膜告诉我们大小、体积和位置,并且十年的临床基础设施都建立在那些输出之上。然而,放射科医生撰写的报告几乎不包含任何掩膜能够表达的内容。我们认为,医学影像研究应该采用医学图像解析作为其核心输出:一种结构化的表示,其中实体、属性和关系被一起输出且相互一致。实体是命名的结构和发现,存在或不存在。属性描述这些实体,捕获诸如边缘规则性、增强模式或严重程度等级等信息。关系将它们连接起来,命名一个结构相对于另一个结构的位置、什么与什么相邻,以及自上次扫描以来发生了什么变化。一个好的解析满足三个属性,按顺序排列:(1)决策(解析命名了当前图像中的正确事物),(2)重建(其内容足够丰富,可以重新生成该图像),以及(3)预测(其内容足够丰富,可以预测患者状态将如何演变)。定量测量是从这些内容中推导出来的;它们不是与之一起预测的。为了测试该领域距离产生这样的输出有多近,我们根据三个解析原语加上闭合性,审计了十一个代表性系统。没有一个系统输出格式良好的解析。实体问题已基本解决。属性、关系和闭合性仍然几乎是空白。前进的道路不是一种新的架构。而是对更丰富输出的承诺,以及对奖励它的训练信号的承诺。分割教会了模型去测量。解析要求它们去解释。
引用
@article{arxiv.2605.11438,
title = {Beyond Masks: The Case for Medical Image Parsing},
author = {Siddharth Gupta and Alan L. Yuille and Zongwei Zhou},
journal= {arXiv preprint arXiv:2605.11438},
year = {2026}
}