SliceWorld:用于CT报告生成的可预测且可控的世界状态模型
计算机视觉与模式识别
2026-05-26 v1 计算与语言
摘要
CT报告生成(CT Report Generation, CTRG)需要模型从数百个轴向切片中总结三维解剖背景和病灶信息。现有方法通常学习直接的图像到文本映射,缺乏对CT证据如何随切片演变或报告如何响应于潜在病灶相关因素控制变更的机制。我们提出SliceWorld,一种针对CT的世界状态框架,将轴向CT扫描视为沿z轴的有序序列。SliceWorld将前缀CT证据编码为包含解剖、病灶和不确定性成分的因素感知潜在状态,并将这些状态投射到用于多步未来切片特征预测、病灶因素干预和基于大语言模型的报告生成中的世界标记。该模型首先在具有预测、因素感知和反事实目标的CT切片序列上进行预训练,然后在配对CT报告数据上进行微调。在M3D-Cap和CT-RATE上的实验表明,SliceWorld在自然语言生成指标和临床导向的自动评估方面均取得改进。进一步的分析表明,实现了多时段未来切片预测、可衡量的因素对齐、减少切片鲁棒性以及选择性病灶敏感报告调制。
引用
@article{arxiv.2605.24371,
title = {SliceWorld: A Predictive and Controllable World-State Model for CT Report Generation},
author = {Yuanhe Tian and Yan Song},
journal= {arXiv preprint arXiv:2605.24371},
year = {2026}
}
备注
18 pages, 5 figures