中文

AI 模型在班夫病灶评分中的局限性与进展

计算机视觉与模式识别 2025-11-03 v1

摘要

班夫分类是评估肾脏移植活检的全球标准,但其半定量性、复杂标准以及观察者间的变异性为计算复制带来了重大挑战。本研究通过模块化、基于规则的框架探索了使用现有深度学习模型近似班夫病灶评分的可行性。我们将每个班夫指标——例如髓鞘光疮(g)、皮质管 capillaritis(ptc)和肠动脉炎(v)——分解为其结构和炎症组成部分,评估当前分割和检测工具能否支持其计算。模型输出通过与专家指南一致的启发式规则映射到班夫评分,并针对专家标注的真实答案进行评估。我们的发现突显了部分成功和关键失败模式,包括结构遗漏、幻觉和检测模糊。即使最终评分与专家注释一致,中间表示的不一致性也常常削弱了可解释性。这一结果揭示了当前AI管道在复制计算专家水平的评分方面的局限性,强调了模块化评估和计算班夫评分标准在指导未来模型发展方面的重要性。

关键词

引用

@article{arxiv.2510.27158,
  title  = {How Close Are We? Limitations and Progress of AI Models in Banff Lesion Scoring},
  author = {Yanfan Zhu and Juming Xiong and Ruining Deng and Yu Wang and Yaohong Wang and Shilin Zhao and Mengmeng Yin and Yuqing Liu and Haichun Yang and Yuankai Huo},
  journal= {arXiv preprint arXiv:2510.27158},
  year   = {2025}
}