用于高效视频分类与检索的可微分辨率压缩与对齐
计算机视觉与模式识别
2023-09-18 v1
摘要
随着各领域对视频分析需求的增长,优化视频推理效率变得愈发重要。一些现有方法通过显式丢弃空间或时间信息来实现高效率,这在快速变化和细粒度场景中带来挑战。为解决这些问题,我们提出一种具有可微分辨率压缩与对齐机制的高效视频表征网络,该机制在网络早期阶段压缩非必要信息以降低计算成本,同时保持一致的时间关联性。具体而言,我们利用可微上下文感知压缩模块对显著与非显著帧特征进行编码,将其精炼并更新为高-低分辨率视频序列。为处理新序列,我们引入一种新的分辨率对齐 Transformer 层,以捕获不同分辨率帧特征间的全局时间关联性,同时通过低分辨率非显著帧中更少的空间 token 将空间计算成本以二次方式降低。整个网络可通过可微压缩模块的集成进行端到端优化。实验结果表明,与最先进方法相比,我们的方法在近重复视频检索上实现了效率与性能的最佳权衡,在动态视频分类上取得了具竞争力的结果。代码:https://github.com/dun-research/DRCA
引用
@article{arxiv.2309.08167,
title = {Differentiable Resolution Compression and Alignment for Efficient Video Classification and Retrieval},
author = {Rui Deng and Qian Wu and Yuke Li and Haoran Fu},
journal= {arXiv preprint arXiv:2309.08167},
year = {2023}
}