让每一帧都有意义:基于自适应视频上下文建模的流式视频连续活动识别
计算机视觉与模式识别
2025-03-14 v2
摘要
视频活动识别在机器人和具身 AI 中日益重要。识别连续视频活动面临诸多挑战,由于流式视频的快速扩张,包含多尺度和未剪辑的活动。我们引入了一个新系统 CARS,通过自适应视频上下文建模来克服这些问题。自适应视频上下文建模指的是在时间和空间维度上选择性地维护与活动相关的特征。CARS 的两个关键设计:第一个是在消除无关视觉特征的同时保持识别准确性的活动空间特征提取;第二个是引入活动感知状态更新,实现对多尺度活动识别的动态适应性。我们的 CARS 在典型边缘设备上运行速度可达 30 FPS 以上,并在准确率上超过所有基线 1.2% 到 79.7%。此外,我们探索将 CARS 应用于大型视频模型作为视频编码器。实验结果表明,CARS 在分布内视频活动数据集上可实现 0.46 分(5 分尺度)的提升,在零样本视频活动数据集上提升范围为 1.19% 到 4%。
引用
@article{arxiv.2410.14993,
title = {Making Every Frame Matter: Continuous Activity Recognition in Streaming Video via Adaptive Video Context Modeling},
author = {Hao Wu and Donglin Bai and Shiqi Jiang and Qianxi Zhang and Yifan Yang and Xin Ding and Ting Cao and Yunxin Liu and Fengyuan Xu},
journal= {arXiv preprint arXiv:2410.14993},
year = {2025}
}