中文

视频教学更好:基于 DEtection TRansformer 的视频到图像知识蒸馏用于医学视频病灶检测

计算机视觉与模式识别 2024-08-27 v1

摘要

AI 辅助的病灶检测模型在癌症早期筛查中发挥着关键作用。然而,之前基于图像的模型忽略了视频中存在的帧间上下文信息。另一方面,视频-based 模型虽能捕获帧间上下文,但计算开销巨大。为缓解这一矛盾,我们利用 DEtection TRansformer 进行视频到图像知识蒸馏,构筑 V2I-DETR 用于医学视频病灶检测。V2I-DETR 采用教师-学生网络范式。教师网络旨在从多帧中提取时序上下文并传递给学生网络,而学生网络是专为快速推理而设计的基于图像的模型。通过将多帧上下文蒸馏到单帧中,所提出的 V2I-DETR 融合了视频模型获取时序上下文的优势与图像模型的推理速度。通过大量实验,我们证明 V2I-DETR 在保持图像模型实时推理速度(30 FPS)的同时,显著优于以往的 SOTA 方法。

关键词

引用

@article{arxiv.2408.14051,
  title  = {Let Video Teaches You More: Video-to-Image Knowledge Distillation using DEtection TRansformer for Medical Video Lesion Detection},
  author = {Yuncheng Jiang and Zixun Zhang and Jun Wei and Chun-Mei Feng and Guanbin Li and Xiang Wan and Shuguang Cui and Zhen Li},
  journal= {arXiv preprint arXiv:2408.14051},
  year   = {2024}
}

备注

BIBM2024