基于步态视频的文本引导的多实例学习用于脊柱侧弯筛查
计算机视觉与模式识别
2025-10-07 v1
摘要
早期脊柱侧弯往往难以检测,尤其是在青少年群体中,延迟诊断可能导致严重的健康问题。传统的X光方法带有辐射风险,且高度依赖临床专家经验,限制了其在大规模筛查中的应用。为克服这些挑战,我们提出了一种基于步态视频的非侵入性脊柱侧弯检测方法——文本引导的多实例学习网络(Text-Guided Multi-Instance Learning Network, TG-MILNet)。为处理步态序列中的时间错位问题,我们采用动态时间变形(Dynamic Time Warping, DTW)聚类对视频进行分段,以提取关键步态阶段。为聚焦于最相关的诊断特征,我们引入了基于区间的注意力机制(Inter-Bag Temporal Attention, IBTA),以突出显示关键步态阶段。鉴于识别边缘病例的困难,我们设计了边界感知模型(Boundary-Aware Model, BAM),以提高对微小脊柱偏离的灵敏度。此外,我们融合了来自领域专家和大语言模型(Large Language Model, LLM)的文本指导,以增强特征表示并提高模型的可解释性。在大型步态数据集Scoliosis1K上的实验表明,TG-MILNet实现了最先进的性能,尤其在处理类别不平衡和准确检测具有挑战性的边缘病例方面表现突出。代码已公开于 https://github.com/lhqqq/TG-MILNet
引用
@article{arxiv.2507.02996,
title = {Text-Guided Multi-Instance Learning for Scoliosis Screening via Gait Video Analysis},
author = {Haiqing Li and Yuzhi Guo and Feng Jiang and Thao M. Dang and Hehuan Ma and Qifeng Zhou and Jean Gao and Junzhou Huang},
journal= {arXiv preprint arXiv:2507.02996},
year = {2025}
}
备注
10.5 pages, 4 figures, MICCAI conference