中文

DL-KDD:用于暗环境下人体动作识别的双光度知识蒸馏

计算机视觉与模式识别 2024-06-05 v1

摘要

在暗色视频中进行人体动作识别是计算机视觉中的一个具有挑战性的任务。最近的研究侧重于应用暗色增强方法来提高视频的可见性。然而,这种视频处理会导致对原始(未增强)视频中关键信息的丢失。相反,传统的双流方法能够从原始视频和处理后的视频中学习信息,但在视频分类任务中,这会导致推理阶段计算成本的显著增加。为解决这些挑战,我们提出了一种 novel 的教师-学生视频分类框架,称为 Dual-Light KnowleDge Distillation for Action Recognition in the Dark (DL-KDD)。该框架使模型能够在推理阶段无需额外计算成本地学习原始视频和增强视频。具体而言,DL-KDD 利用知识蒸馏训练策略。教师模型使用增强视频训练,学生模型则使用原始视频和教师模型生成的软目标进行训练。这种教师-学生框架允许学生模型仅使用原始输入视频进行动作预测。在我们的实验中,提出的 DL-KDD 框架在 ARID、ARID V1.5 和 Dark-48 数据集上均优于最先进的方法。我们在每个数据集上均取得最佳性能,并在 Dark-48 数据集上实现了最高达 4.18% 的提升,仅使用原始视频输入,避免了在推理中使用双流框架或增强模块。我们进一步通过消融实验验证了蒸馈策略的有效性。结果表明,该知识蒸馏框架在暗环境下人体动作识别方面具有显著优势。

关键词

引用

@article{arxiv.2406.02468,
  title  = {DL-KDD: Dual-Light Knowledge Distillation for Action Recognition in the Dark},
  author = {Chi-Jui Chang and Oscar Tai-Yuan Chen and Vincent S. Tseng},
  journal= {arXiv preprint arXiv:2406.02468},
  year   = {2024}
}