学习重要内容:基于相对误差驱动样本选择的优先概念学习
计算机视觉与模式识别
2026-02-26 v2 人工智能
摘要
指令微调是近期视觉语言模型(VLMs)取得成功的关键,但其成本高昂——需要大规模数据集、高质量标注和大量计算预算。我们提出基于相对误差驱动样本选择的优先概念学习(PRioritized cOncept learninG via Relative Error-driven Sample Selection,PROGRESS),这是一个数据与计算高效的框架,使 VLMs 能够在训练过程中根据自身不断演进的需求动态选择下一步学习的内容。在每个阶段,模型跟踪其在各项技能上的学习进度,并选择信息量最大的样本——即那些模型尚未掌握且在当前训练阶段难度不大的样本。该策略有效控制了技能的获取以及技能学习的顺序。具体而言,我们从展现出最高学习进度的技能中采样,优先选择进步最快的技能。与以往方法不同,PROGRESS 无需预先获取答案标注,仅在需要时查询答案,避免依赖辅助 VLMs 的额外监督,且不需要计算量大的梯度计算来进行数据选择。在多个不同规模的指令微调数据集上的实验表明,PROGRESS 以更少的数据和监督持续优于 SOTA 基线方法。此外,我们展示了其强大的跨架构泛化能力以及对更大模型的可迁移性,验证了 PROGRESS 作为高效学习可扩展解决方案的有效性。
引用
@article{arxiv.2506.01085,
title = {Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection},
author = {Shivam Chandhok and Qian Yang and Oscar Manas and Kanishk Jain and Leonid Sigal and Aishwarya Agrawal},
journal= {arXiv preprint arXiv:2506.01085},
year = {2026}
}
备注
CVPR 2026