将 CT 扫描视为视频:基于多目标跟踪的颅内出血检测
计算机视觉与模式识别
2026-01-07 v1
摘要
体积医学影像的自动分析在边缘设备上受到严重限制,因高昂的 3D 卷积神经网络 (CNN) 内存和计算需求。本文开发了一种轻量级计算机视觉框架,通过将体积 CT 数据重新构思为顺序视频流,来协调 2D 检测效率与 3D 背景的必要性。这种视频观点方法应用于基于 Hemorica 数据集的即时颅内出血 (ICH) 检测任务。为确保操作效率,我们对多代 YOLO 架构(v8、v10、v11 和 v12)在 Nano 配置下的性能进行基准测试,选取 mAP@50 最高的版本作为切片级 backbone。随后引入 ByteTrack 算法以确保沿 轴的解剖一致性。为解决视频跟踪器固有的初始化滞后,我们提出了混合推理策略和时空一致性滤波器,以区分真实病灶与瞬时预测噪声。在独立测试数据上的实验结果表明,所提出的框架作为严格的时序验证器,将基线 2D 检测器的检测精度从 0.703 提升到 0.779,同时保持高灵敏度。通过以极低的计算成本近似 3D 背景推理,该方法为在资源受限环境(如移动中风单元和物联网-enabled 远程诊所)中实现实时患者优先级识别提供了可扩展解决方案。
引用
@article{arxiv.2601.02521,
title = {CT Scans As Video: Efficient Intracranial Hemorrhage Detection Using Multi-Object Tracking},
author = {Amirreza Parvahan and Mohammad Hoseyni and Javad Khoramdel and Amirhossein Nikoofard},
journal= {arXiv preprint arXiv:2601.02521},
year = {2026}
}