LookWhen?通过学习何时、何地及计算什么来实现快速视频识别
计算机视觉与模式识别
2026-05-11 v1 机器学习
摘要
Transformer 主导着视频识别。它们将视频分割为 token,而处理这些 token 具有昂贵的超线性计算成本。然而视频中充满了冗余,因此我们可以质疑这种开销的必要性。我们引入了 LookWhen,一个将视频识别分解为学习何时、何地以及计算什么的选择器-提取器框架。我们的浅层选择器获取缩小规模的视频并快速对时空中的所有 token 进行评分,而我们的深层提取器获取选出的 top-K token,以在不实际处理所有 token 的情况下逼近完整视频表征。一个关键挑战是为选择和提取定义有效的监督。对于选择预训练,我们引入了一种基于表征的评分,利用简单的最近邻距离按独特性对 token 进行排序。对于提取预训练,我们蒸馏视频教师模型和图像教师模型,并对其逐帧表征进行归一化,以学习视频内部的变化。通过这些策略,我们的选择器-提取器学习到了通用且高效的表征,可用于特征提取或针对特定任务进行微调。通过在 Kinetics-400、SSv2、Epic-Kitchens、Diving48、Jester 和 Charades 上的实验,我们表明 LookWhen 比同等规模的高效模型和升级基线实现了更好的精度-计算权衡。LookWhen 在 12 个案例(6 个任务 × 2 种设置)中的 9 个案例的精度-FLOPs 上实现了帕累托最优,并在其余 3 个案例上大致持平。在实际测量时间的精度-吞吐量方面,LookWhen 在同等精度下效率依然更高,比 InternVideo2-B 快 6.7 倍。
引用
@article{arxiv.2605.06809,
title = {LookWhen? Fast Video Recognition by Learning When, Where, and What to Compute},
author = {Ali Salamatian and Anthony Fuller and Pritam Sarkar and James R. Green and Leonid Sigal and Evan Shelhamer},
journal= {arXiv preprint arXiv:2605.06809},
year = {2026}
}