中文

ViPTT-Net:用于胸部 CT 扫描结核病类型分类的时空模型视频预训练

计算机视觉与模式识别 2021-05-28 v1 机器学习

摘要

预训练在深度学习工作流中引发了浓厚兴趣,以从有限数据中学习并改善泛化能力。尽管这在 2D 图像分类任务中很常见,但其在胸部 CT 解读等 3D 医学成像任务中的应用仍有限。我们探究这样一种思路:对真实视频预训练模型是否能比从零开始训练模型提升性能,该模型旨在用于胸部 CT 扫描的结核病类型分类。为同时纳入空间与时间特征,我们开发了一种混合卷积神经网络(CNN)与循环神经网络(RNN)模型,其中 CT 扫描各轴向切片的特徵由 CNN 提取,这些图像特征序列被输入 RNN 以对 CT 扫描进行分类。我们所称的 ViPTT-Net 模型在超过 1300 个带人类活动标签的视频片段上训练,随后在带结核病类型标签的胸部 CT 扫描上微调。我们发现,在视频上预训练模型可得到更好的表示,并将模型验证性能从 kappa 分数 0.17 显著提升至 0.35,尤其对于代表性不足的类别样本。我们的最佳方法在 ImageCLEF 2021 结核病——TBT 分类任务中取得第 2 名,在仅使用图像信息(未使用临床元数据)的最终测试集上 kappa 分数为 0.20。所有代码与模型均已公开。

关键词

引用

@article{arxiv.2105.12810,
  title  = {ViPTT-Net: Video pretraining of spatio-temporal model for tuberculosis type classification from chest CT scans},
  author = {Hasib Zunair and Aimon Rahman and Nabeel Mohammed},
  journal= {arXiv preprint arXiv:2105.12810},
  year   = {2021}
}

备注

Under review at CLEF 2021. 10 pages