时间与空间:比较 DINOv3 与 V-JEPA2 在视频动作分析中的特征表示
计算机视觉与模式识别
2025-09-29 v1 人工智能
摘要
本研究对两种用于视频动作识别的 prominent 自监督学习架构进行了全面的比较分析:通过空间特征提取独立处理各帧的 DINOv3,以及在视频序列中采用联合时间建模的 V-JEPA2。我们在 UCF Sports 数据集上对两种方法进行了评估,从分类准确率、聚类性能、类内一致性和类间区分度等多个维度考察了特征质量。我们的分析揭示了根本性的架构权衡:DINOv3 取得了更优的聚类性能(Silhouette score:0.31 vs 0.21),并表现出卓越的区分能力(6.16x 分离比),尤其是对于姿态可识别的动作;而 V-JEPA2 在所有动作类型上均表现出一致的可靠性,且性能方差显著更低(0.094 vs 0.288)。通过针对特定动作的评估,我们发现 DINOv3 的空间处理架构在静态姿态识别方面表现出色,但在依赖运动的动作上性能下降;而 V-JEPA2 的时间建模在多样的动作类别中提供了均衡的表示质量。这些发现有助于理解视频分析系统中的架构设计选择,并为根据任务需求和可靠性约束选择合适的特征提取方法提供了实证指导。
引用
@article{arxiv.2509.21595,
title = {Temporal vs. Spatial: Comparing DINOv3 and V-JEPA2 Feature Representations for Video Action Analysis},
author = {Sai Varun Kodathala and Rakesh Vunnam},
journal= {arXiv preprint arXiv:2509.21595},
year = {2025}
}