见暗处:基于知识蒸馏和对比学习的暗色视频动作识别教师-学生框架
计算机视觉与模式识别
2025-10-21 v2 人工智能
人机交互
机器学习
多媒体
摘要
在暗色或低光照(欠曝)视频中进行动作识别是一个具有挑战性的任务,因为可见性下降会阻碍关键时空细节。本文提出了 ActLumos,一个教师-学生框架,在保持单流推理的同时保留多流水平的准确率。教师模型消耗双流输入,包括原始暗帧和暗色增强帧,由权重共享的 R(2+1)D-34 主干网络处理并通过动态特征融合(DFF)模块融合,该模块在每个时间步动态重新加权两个流,强调最具信息性的时序片段。教师模型还包含监督对比损失(SupCon),以锐化类别间的边缘。学生模型共享 R(2+1)D-34 主干网络,但仅使用暗帧且不进行融合,以便在测试时使用。学生模型首先在无标签的暗视频剪辑上进行自监督预训练,然后通过教师模型的知识蒸馏进行微调,将教师的多流知识转化为单流模型。在单流推理下,蒸馏后的学生模型在 ARID V1.0 上实现 96.92%(Top-1)的领先准确率,在 ARID V1.5 上实现 88.27%,在 Dark48 上实现 48.96%。消融研究进一步突显了每个组件的独立贡献,即教师中的 DFF 优于单一或静态融合,知识蒸馏(KD)将这些收益传递给单流学生模型,两视图时空 SSL 优于仅空间或仅时间变体且不增加推理成本。
引用
@article{arxiv.2502.03724,
title = {Seeing in the Dark: A Teacher-Student Framework for Dark Video Action Recognition via Knowledge Distillation and Contrastive Learning},
author = {Sharana Dharshikgan Suresh Dass and Hrishav Bakul Barua and Ganesh Krishnasamy and Raveendran Paramesran and Raphael C. -W. Phan},
journal= {arXiv preprint arXiv:2502.03724},
year = {2025}
}