FineVision:开放数据就是唯一的钥匙
计算机视觉与模式识别
2026-05-21 v2 人工智能
摘要
视觉-语言模型(Vision-Language Models, VLMs)的发展受制于公共数据集碎片化、一致性和污染的现状。我们引入FineVision,一个精心收集、精细整理和统一的2400万样本语料库——目前规模最大的开放资源。我们通过半自动、人工在环管道将200多个来源整合为185个子集:自动化执行批量导入和模式映射,而审阅员审查映射并抽查输出以验证注释忠实消费、格式合适且多样性和安全性;问题触发针对性修复和重新运行。该工作流程还对来源内部及跨来源进行严格去重,并针对66个公共基准进行去污。FineVision还包含具有统一行动空间的agentic/GUI任务;审阅员验证模式并检查一部分轨迹以确认可执行忠实。在广泛的评估套件上,训练FineVision的模型 consistently优于训练现有开放混合数据的模型,凸显了规模、数据卫生和人工监督下的自动化平衡的好处。我们发布语料库和 curation工具以加速数据中心VLMs研究。
引用
@article{arxiv.2510.17269,
title = {FineVision: Open Data Is All You Need},
author = {Luis Wiedmann and Orr Zohar and Amir Mahla and Xiaohan Wang and Rui Li and Thibaud Frere and Leandro von Werra and Aritra Roy Gosthipaty and Andrés Marafioti},
journal= {arXiv preprint arXiv:2510.17269},
year = {2026}
}