中文

SkillRater:解构多模态数据中的能力

机器学习 2026-02-13 v1

摘要

数据聚焦方法通常为样本分配单个质量分数。我们认为这种标量框架本质上受限:当训练需要多个 distinct 能力时,单一的评分器无法同时最大化所有它们的有用信号。质量更适合作为多维的,每个维度对应模型必须获取的一种能力。我们提出 SkillRater,一个将数据过滤分解为专门的评分器的框架——每个能力一个评分器,通过 meta 学习在一个独立的验证目标上进行训练——并通过一种渐进的选择规则来组合它们的分数:在每个训练阶段,如果任何评分器将其排名放在随时间收紧的阈值之上,则保留该样本,早期保留多样性,晚期集中在高价值样本。我们在视觉语言模型上验证了这种方法,将质量分解为三个能力维度:视觉理解、OCR 和 STEM 推理。在 20 亿参数规模下,SkillRater 在视觉理解上比未过滤的基线提高 5.63%,OCR 提高 2.00%,STEM 提高 3.53%。所学得的评分器信号接近正交,这表明分解捕捉到了真正独立的质量维度,解释了为何它优于未过滤训练和单一的学习式过滤。

关键词

引用

@article{arxiv.2602.11615,
  title  = {SkillRater: Untangling Capabilities in Multimodal Data},
  author = {Naveen Sahi and Jeremy Dohmann and Armen Aghajanyan and Akshat Shrivastava},
  journal= {arXiv preprint arXiv:2602.11615},
  year   = {2026}
}