特征幻视用于自监督动作识别
计算机视觉与模式识别
2025-06-26 v1 人工智能
机器学习
摘要
理解视频中人类动作不仅需要原始像素分析,还依赖于高层次语义推理和有效地整合多模态特征。我们提出了一种深度翻译性动作识别框架,通过联合预测RGB视频帧中的动作概念和辅助特征来提高识别准确率。在测试阶段,幻视流推断缺失的线索,丰富特征表示而不会增加计算开销。为聚焦于原始像素之外的动作相关区域,我们引入两种新颖的领域特定描述符。对象检测特征(ODF)汇聚来自多个对象检测器的输出,以捕获上下文线索;显著性检测特征(SDF)突出显示动作识别所必需的空间和强度模式。我们的框架无缝地将这些描述符与光流、改进的密集轨迹、骨架数据和音频线索等辅助模态集成。它与包括I3D、AssembleNet、Video Transformer Network、FASTER以及最新模型如VideoMAE V2和InternVideo2兼容。为处理辅助特征中的不确定性,我们在幻视步骤中融入阿尔泔尔不确定性建模,并引入鲁棒损失函数以缓解特征噪声。我们的多模态自监督动作识别框架在包括Kinetics-400、Kinetics-600和Something-Something V2在内的多个基准上实现了最先进的性能,展示了其在捕捉细粒度动作动态方面的有效性。
引用
@article{arxiv.2506.20342,
title = {Feature Hallucination for Self-supervised Action Recognition},
author = {Lei Wang and Piotr Koniusz},
journal= {arXiv preprint arXiv:2506.20342},
year = {2025}
}
备注
Accepted for publication in International Journal of Computer Vision (IJCV)