EfficientFSL:通过 Vision Transformer 中的仅查询微调增强少样本分类
计算机视觉与模式识别
2026-01-16 v2 人工智能
摘要
Vision Transformer(ViT)等大模型因其强大的表示能力,在少样本分类中展现出远超 ResNet 等小型架构的显著优势。然而,微调此类大模型需要大量 GPU 内存和漫长的训练时间,使其在许多现实世界的低资源场景中不切实际。为了弥合这一差距,我们提出了 EfficientFSL,一种专为 ViT 少样本分类量身定制的仅查询微调框架,它在显著降低计算开销的同时实现了具有竞争力的性能。EfficientFSL 充分利用预训练模型中嵌入的知识及其强大的理解能力,以极少量的可调参数实现了高分类精度。具体而言,我们引入了一个轻量级可训练的 Forward Block 来合成特定于任务的查询,以仅查询的方式从预训练模型的中间表示中提取信息特征。我们进一步提出了一个 Combine Block 来融合多层输出,增强特征表示的深度和鲁棒性。最后,Support-Query Attention Block 通过调整原型以与查询集分布对齐来缓解分布偏移。凭借极少量的可调参数,EfficientFSL 在四个域内少样本数据集和六个跨域数据集上取得了 state-of-the-art 的性能,证明了其在实际应用中的有效性。
引用
@article{arxiv.2601.08499,
title = {EfficientFSL: Enhancing Few-Shot Classification via Query-Only Tuning in Vision Transformers},
author = {Wenwen Liao and Hang Ruan and Jianbo Yu and Bing Song and YuansongWang and Xiaofeng Yang},
journal= {arXiv preprint arXiv:2601.08499},
year = {2026}
}
备注
Accepted/To be presented at AAAI 2026