标记无关肺肿瘤运动预测中的患者特定 vs 多患者视觉Transformer
计算机视觉与模式识别
2025-07-11 v1
摘要
背景:准确预测肺肿瘤运动对于在质子治疗中实现精准剂量输送至关重要。虽然当前的标记无关方法大多依赖深度学习,但视觉Transformer在此领域尚未得到探索,尽管其在轨迹预测中已证明优异性能。目的:本工作引入一种基于视觉Transformer(ViT)的标记无关预测方法,用于肺肿瘤运动。评估了两种训练策略,在临床现实约束下:一种是患者特定(PS)方法,学习个体化运动模式;另一种是多患者(MP)模型,旨在实现泛化。两种方法均在计划阶段(T1)和治疗阶段(T2)的数据上进行评估。方法:使用31位患者的计划4DCT扫描生成的数字重构放射片(DRR)用于训练MP模型;第32位患者被保留用于评估。PS模型仅使用目标患者的计划数据进行训练。两种模型均使用16张DRR作为输入,预测肺肿瘤在1秒时域内的运动。性能通过平均位移误差(ADE)和最终位移误差(FDE)评估,分别在T1和T2数据上进行。结果:在T1数据上,PS模型在所有训练集大小下均优于MP模型,尤其在较大数据集(最高达25,000张DRR,p<0.05)时表现更佳。然而,MP模型在跨剂量解剖变异性方面表现出更强鲁棒性,并在无需重新训练的情况下在T2数据上实现相当的性能。结论:本文首次将ViT架构应用于标记无关肿瘤运动预测。虽然PS模型实现更高的精度,但MP模型在不考虑训练的情况下表现出更强的鲁棒性,适用于时间受限的临床环境。
引用
@article{arxiv.2507.07811,
title = {Patient-specific vs Multi-Patient Vision Transformer for Markerless Tumor Motion Forecasting},
author = {Gauthier Rotsart de Hertaing and Dani Manjah and Benoit Macq},
journal= {arXiv preprint arXiv:2507.07811},
year = {2025}
}