基于对比学习的辅助分支方法用于视频目标检测
计算机视觉与模式识别
2025-08-29 v1
摘要
视频目标检测是一项具有挑战性的任务,因为视频常常受到图像退化现象的影响,如运动模糊、遮挡和可变形形状,这使得其在静帧图像上的目标检测要难得多。先前的方法通过采用特征聚合和复杂的后处理技术来提高视频目标检测性能,但代价是增加了计算需求。为在推理阶段无需额外计算负担的情况下提高对图像退化的鲁棒性,我们引入一种直截了当且高效的对比学习辅助分支(Contrastive Learning through Auxiliary Branch, CLAB)方法。首先,我们使用对比损失实现一个对比辅助分支,以增强视频目标检测器背部特征表示能力。接着,我们提出一种动态损失加权策略,强调训练初期的辅助特征学习,而在训练收敛时逐渐优先检测任务。我们通过全面的实验和消融研究来验证了该方法,表明性能稳步提升。无需任何花哨的技巧,CLAB 在 ImageNet VID 数据集上分别以 84.0% 和 85.2% 的 mAP 达到性能,实现了基于 CNN 的模型在不要求额外后处理方法的情况下的领先水平。
关键词
引用
@article{arxiv.2508.20551,
title = {Contrastive Learning through Auxiliary Branch for Video Object Detection},
author = {Lucas Rakotoarivony},
journal= {arXiv preprint arXiv:2508.20551},
year = {2025}
}
备注
Accepted paper for ACIVS 2025