LPT++:长尾专家混合模型的高效训练
计算机视觉与模式识别
2024-09-18 v1 机器学习
摘要
我们提出了LPT++,一个用于长尾分类的综合框架,它结合了参数高效微调(PEFT)和可学习的模型集成。LPT++通过集成三个核心组件来增强冻结的视觉Transformer(ViT)。第一个是通用长尾适应模块,它聚合了长尾提示和视觉适配器,以使预训练模型适应目标域,同时提高其判别能力。第二个是带有混合专家(MoE)评分器的长尾专家混合框架,该评分器自适应地为来自纯视觉和视觉-语言(VL)模型专家的置信度分数计算重新加权系数,以生成更准确的预测。最后,LPT++采用三阶段训练框架,其中每个关键模块都单独学习,从而形成一个稳定且有效的长尾分类训练范式。此外,我们还提出了LPT++的简化版本LPT,它仅集成纯视觉预训练的ViT和长尾提示来构建单模型方法。LPT可以清晰地说明长尾提示如何工作,同时在没有VL预训练模型的情况下实现可比的性能。实验表明,仅使用约1%的额外可训练参数,LPT++就能达到与所有同类方法相当的准确率。
引用
@article{arxiv.2409.11323,
title = {LPT++: Efficient Training on Mixture of Long-tailed Experts},
author = {Bowen Dong and Pan Zhou and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2409.11323},
year = {2024}
}
备注
Extended version of arXiv:2210.01033