Task-Adapter++:面向小样本动作识别的任务特定自适应与顺序感知对齐
计算机视觉与模式识别
2025-07-04 v2
摘要
大规模预训练模型在语言和图像任务中取得了显著成功,促使越来越多的研究探索将预训练图像模型(如CLIP)应用于小样本动作识别领域。然而,当前方法普遍存在几个问题:1)直接微调通常会损害预训练模型的泛化能力;2)在视觉任务中对任务特定信息的探索不足;3)文本建模过程中通常忽略了语义顺序信息;4)现有的跨模态对齐技术忽略了多模态信息的时间耦合。为了解决这些问题,我们提出了Task-Adapter++,这是一种针对图像和文本编码器的参数高效双重自适应方法。具体来说,为了充分利用不同小样本学习任务之间的变化,我们为图像编码器设计了一种任务特定自适应,以便在特征提取过程中能很好地注意到最具判别性的信息。此外,我们利用大语言模型为每个动作类别生成详细的顺序子动作描述,并在文本编码器中引入语义顺序适配器,以有效建模这些子动作之间的顺序关系。最后,我们开发了一种创新的细粒度跨模态对齐策略,该策略主动将视觉特征映射到与语义描述相同的时间阶段。大量实验充分证明了所提方法的有效性和优越性,其在5个基准上一致地达到了最先进的性能。代码已开源,地址为https://github.com/Jaulin-Bage/Task-Adapter-pp。
引用
@article{arxiv.2505.06002,
title = {Task-Adapter++: Task-specific Adaptation with Order-aware Alignment for Few-shot Action Recognition},
author = {Congqi Cao and Peiheng Han and Yueran zhang and Yating Yu and Qinyi Lv and Lingtong Min and Yanning zhang},
journal= {arXiv preprint arXiv:2505.06002},
year = {2025}
}
备注
extended work of Task-Adapter