中文

探索面向大规模视觉模型的 PEFT:QLoRA 与 DoRA 在 98:1 测试-训练比下图像分类的泛化洞察

计算机视觉与模式识别 2026-03-19 v1

摘要

自动化行为分类是精密农业养殖的关键任务,但面临高计算成本和有限标注数据的挑战。本研究系统比较了三种方法:从头训练 (ResNet-18、ViT-Small)、冻结特征提取,以及对 DINOv3 基础模型 (67 亿参数) 进行参数高效微调 (PEFT)。我们评估了 QLoRA 和 DoRA across 多个配置,变更 rank (8、16、64) 和目标模块 (q_proj versus 所有线性层)。在 2,160 个验证训练图像上,我们评估了模型在 211,800 个测试样本上的泛化能力,这实际上是一个 98:1 的测试-训练比。结果表明,PEFT 显著优于其他方法,其中最佳 QLoRA 配置 (所有线性层且 rank=64) 在 5.8 小时内实现 83.16% 的测试准确率,仅使用 2.72% 参数 (1.83 亿),而 ResNet-18 为 72.87% (16.8 小时),ViT-Small 为 61.91% (18.7 小时),冻结 DINOv3 为 76.56% (17.5 小时)。DoRA 达到相当的准确率 (83.14%) 但耗时更长 (11.0 小时)。值得注意的是,增加适配器容量持续改善泛化,同时未导致过拟合:将 rank从 16 降至 8使测试准确率从 78.38% 降至 77.17%,而将 q_proj-only 扩展至所有线性层且 rank=64使准确率从 78.38% 提升至 83.16%。这表明,在将基础模型适应农业图像时,欠拟合而非过拟合是主要挑战。我们的发现为在农业畜牧应用中部署大型视觉模型提供了 PEFT 的指导方针。

关键词

引用

@article{arxiv.2603.17782,
  title  = {Exploring parameter-efficient fine-tuning (PEFT) of billion-parameter vision models with QLoRA and DoRA: insights into generalization for limited-data image classification under a 98:1 test-to-train regime},
  author = {Haiyu Yang and Sumit Sharma and Enhong Liu and Miel Hostens},
  journal= {arXiv preprint arXiv:2603.17782},
  year   = {2026}
}