用于无标签视频特征提取的快速深度预测编码网络
计算机视觉与模式识别
2024-09-10 v1 信号处理
摘要
受大脑启发的深度预测编码网络(DPCN)通过双向信息流有效地建模和捕获视频特征,即使在没有标签的情况下也是如此。它们基于视频场景的过完备描述,而瓶颈之一一直是缺乏有效的稀疏化技术来寻找判别性和鲁棒性的字典。FISTA一直是最佳替代方案。本文提出了一种具有内部模型变量(状态和原因)快速推理的DPCN,实现了高稀疏性和特征聚类准确性。所提出的无监督学习过程,受自适应动态规划和最小化-最大化框架的启发,其收敛性得到了严格分析。在CIFAR-10、Super Mario Bros视频游戏和Coil-100数据集上的实验验证了该方法,它在学习率、稀疏比和特征聚类准确性方面优于先前版本的DPCN。由于DPCN的坚实基础和可解释性,这一进展为无标签视频中物体识别的广泛应用打开了大门。
引用
@article{arxiv.2409.04945,
title = {Fast Deep Predictive Coding Networks for Videos Feature Extraction without Labels},
author = {Wenqian Xue and Chi Ding and Jose Principe},
journal= {arXiv preprint arXiv:2409.04945},
year = {2024}
}