TAMT:用于跨域少样本动作识别的时序感知模型调优
计算机视觉与模式识别
2025-04-04 v2
摘要
跨域少样本动作识别(CDFSAR)近年来受到关注,旨在解决源域到目标域之间存在的数据分布差异。现有 CDFSAR 方法主要关注源域和目标域数据的联合训练,以缓解域间差异的副作用。然而,这类方法存在两个局限性:其一,基于成对的联合训练需要针对一个源数据和多个目标数据重新训练深度模型,这在源数据大而目标数据小的情况下会导致巨大的计算成本;其二,经过联合训练后的预训练模型被直接应用于目标域,很少充分发挥预训练模型的潜力,从而限制了识别性能。为克服上述局限性,本文提出了一种简单而有效的基线方法,即时序感知模型调优(TAMT),用于 CDFSAR。具体而言,TAMT 采用解耦范式,即在源数据上进行预训练,在目标数据上进行微调,避免了针对单个源数据和多个目标数据进行重新训练的情形。为了有效且高效地探索预训练模型在迁移到目标域时所具有的潜力,TAMT 提出了层次化时序调优网络(HTTN),其核心涉及局部时序感知适配器(TAA)和全局时序感知时刻调优(GTMT)。其中,TAA 学习少量参数来 recalibrate 冻结预训练模型的中间特征,从而实现对目标域的高效适应。此外,GTMT 有助于生成强大的视频表征,提高在目标域上的匹配性能。在多个广泛使用的视频基准测试上进行实验表明,TAMT 比最近提出的方法提高了 13%~31%,实现了新的 CDFSAR 最佳结果。
引用
@article{arxiv.2411.19041,
title = {TAMT: Temporal-Aware Model Tuning for Cross-Domain Few-Shot Action Recognition},
author = {Yilong Wang and Zilin Gao and Qilong Wang and Zhaofeng Chen and Peihua Li and Qinghua Hu},
journal= {arXiv preprint arXiv:2411.19041},
year = {2025}
}
备注
Accepted by CVPR 2025; Project page: https://github.com/TJU-YDragonW/TAMT