D$^2$ST-Adapter:用于少样本动作识别的解耦可变形时空适配器
计算机视觉与模式识别
2025-07-01 v4
摘要
将预训练图像模型适配到视频模态已被证明是进行鲁棒少样本动作识别的有效策略。在本工作中,我们探索了图像到视频模型适配中适配器微调的潜力,并提出了一种新颖的视频适配器微调框架,称为解耦可变形时空适配器(DST-Adapter)。它具有轻量级设计、低适配开销和强大的时空特征适配能力。DST-Adapter 采用内部双路径架构构建,能够在适配器内实现对空间和时间特征的内置解耦编码,并无缝集成到预训练图像模型的单流特征学习框架中。特别地,我们开发了 DST-Adapter 的高效且有效的实现,将专门设计的各向异性可变形时空注意力作为其关键操作。该机制可以在三维时空空间中沿空间和时间域以各向异性采样密度对两条路径进行单独定制,从而在保持轻量级设计的同时实现对空间和时间特征的解耦编码。通过在预训练的 ResNet 和 ViT 上实例化我们的方法,大量实验证明了我们的方法优于现有方法。我们的方法特别适合于时间动态对动作识别至关重要的挑战性场景。代码可在 https://github.com/qizhongtan/D2ST-Adapter 获取。
引用
@article{arxiv.2312.01431,
title = {D$^2$ST-Adapter: Disentangled-and-Deformable Spatio-Temporal Adapter for Few-shot Action Recognition},
author = {Wenjie Pei and Qizhong Tan and Guangming Lu and Jiandong Tian and Jun Yu},
journal= {arXiv preprint arXiv:2312.01431},
year = {2025}
}
备注
Accepted by ICCV2025