揭示内在能力:视觉语言模型数据策展的范式
计算机视觉与模式识别
2026-01-15 v2 人工智能
摘要
大型视觉语言模型(VLM)取得了强劲的基准性能,但通过指令微调控制其行为仍然困难。减少指令微调数据集的预算常导致性能下降,因为启发式策略将模型视为黑箱,忽视了支配学习的潜在能力。我们提出了能力归因数据策展(Capability-Attributed Data Curation, CADC),一种将策展从任务特定启发式转向内在能力分析的框架。CADC 从梯度基础学习轨迹中以无监督方式发现内在能力,通过影响估计将训练数据归因于这些能力,并通过平衡选择和分阶段排序策展出能力感知的课程。这将黑箱指令微调转化为可控的、以能力为导向的过程。在仅使用原始数据的 5% 时,CADC 就在多模态基准测试中超越了完整数据训练。这些结果验证了内在能力是模型学习的基本构件,并将 CADC 确立为指令数据策展的原则范式。
引用
@article{arxiv.2510.00040,
title = {Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models},
author = {Junjie Li and Ziao Wang and Jianghong Ma and Xiaofeng Zhang},
journal= {arXiv preprint arXiv:2510.00040},
year = {2026}
}