中文

表征几何塑造 CT 肠镜视觉语言建模中的任务性能

计算机视觉与模式识别 2026-04-15 v1 人工智能

摘要

CT 肠镜是评估炎症性肠病 (IBD) 的主要影像模态,但尚不清楚哪些表征选择能最好地支持该模态的自动分析。我们首次对腹部 CT 肠镜进行视觉语言迁移学习研究,确定了两项主要发现。第一,均值池化切片嵌入在分类性疾病评估中表现更好(三分类准确率 59.2%),而注意力池化在跨模态检索中更佳(0.235 text-to-image MRR)。这一模式在所有测试的 LoRA 配置中均成立,表明两种聚合器强调所学表征的不同属性。第二,切片组织对比度比更广的空间覆盖更重要:多窗口 RGB 编码将互补 Hounsfield Unit 窗口映射到 RGB 通道,凌超所有通过多视图采样增加空间覆盖的策略;在此设置下,添加腰椎和侧位视图反而会降低分类性能。对于报告生成,无检索上下文微调仅达到 within-1 严重度准确率接近机会水平(70.4% vs. 71% 随机),暗示仅受类分布影响的排序学习有限。检索增强生成 (RAG) 在所有配置中均提升此成绩,得分比机会基准高出 7~14 个百分点,Ordinal MAE 从 0.98 降至 0.80~0.89。三教师伪标签框架使所有比较无需专家标注。综上,这些发现为本欠探索的模态提供了首批基准,并为构建体积医学影像视觉语言系统提供了实用指导。

关键词

引用

@article{arxiv.2604.13021,
  title  = {Representation geometry shapes task performance in vision-language modeling for CT enterography},
  author = {Cristian Minoccheri and Emily Wittrup and Kayvan Najarian and Ryan Stidham},
  journal= {arXiv preprint arXiv:2604.13021},
  year   = {2026}
}