视频模型能否成为医学影像中的零样本学习者和推理者?
计算机视觉与模式识别
2026-04-27 v2
摘要
大型生成模型的最新进展表明,简单的自回归公式在适当扩展时,可以在不同领域展现出强大的零样本泛化能力。受此趋势启发,我们研究了自回归视频建模原理是否可以直接应用于医学影像任务,尽管该模型从未在医学数据上训练过。具体来说,我们在四个代表性任务上评估了一个大型视觉模型(LVM)的零样本性能:器官分割、去噪、超分辨率和运动预测。值得注意的是,即使没有领域特定的微调,该LVM也能在CT扫描中描绘解剖结构,并在分割、去噪和超分辨率上取得有竞争力的性能。最引人注目的是,在放射治疗运动预测中,该模型直接从4D CT扫描的先前相位预测未来的3D CT相位,产生解剖结构一致的预测,捕捉患者特定的呼吸动力学,并具有逼真的时间连贯性。我们在来自122名患者的4D CT数据上评估了该LVM,总计超过1,820个3D CT体积。尽管之前没有接触过医学数据,该模型在所有任务上都取得了强劲的性能,并在运动预测方面超越了专门的基于DVF和生成式基线,达到了最先进的空间精度。这些发现揭示了医学视频建模中零样本能力的涌现,并突显了通用视频模型作为统一学习者和推理者的潜力,为未来基于视频模型的医学基础模型奠定了基础。
引用
@article{arxiv.2510.10254,
title = {Are Video Models Emerging as Zero-Shot Learners and Reasoners in Medical Imaging?},
author = {Yuxiang Lai and Jike Zhong and Ming Li and Yuheng Li and Xiaofeng Yang},
journal= {arXiv preprint arXiv:2510.10254},
year = {2026}
}