Frame2Freq:用于细粒度视频理解的频谱适配器
计算机视觉与模式识别
2026-02-24 v1
摘要
将图像预训练 backbone 适用于视频通常依赖于针对单个时间尺度调整的时域适配器。我们的实验表明,这些模块会捕获静态图像线索和非常快的闪烁变化,同时忽略中等速度的运动。然而,捕获跨多个时间尺度的动力学对于细粒度的时间分析(例如,打开 vs. 关闭瓶子)至关重要。为此,我们引入 Frame2Freq——一系列频率感知适配器,在图像到视频转换期间进行频谱编码,以适应预训练 Vision Foundation Models(VFMs),提高细粒度动作识别。Frame2Freq 沿时间轴使用快速傅里叶变换(FFT),并学习频率带特定嵌入,适应性地突出显示最具辨识力的频率范围。在五个细粒度活动识别数据集上,Frame2Freq 在所有数据集上都优于先前的 PEFT 方法,并且在四个数据集上甚至超过了完全微调的模型。这些结果为证明频率分析方法是建模图像到视频转换中时序动态的强大工具提供了鼓舞人心的证据。代码可在 https://github.com/th-nesh/Frame2Freq 查看。
引用
@article{arxiv.2602.18977,
title = {Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding},
author = {Thinesh Thiyakesan Ponbagavathi and Constantin Seibold and Alina Roitberg},
journal= {arXiv preprint arXiv:2602.18977},
year = {2026}
}
备注
Accepted to CVPR 2026 (Main Track)