ImageNet-Think-250K:面向视觉语言模型的大规模多模态推理合成数据集
计算机视觉与模式识别
2025-10-03 v1 机器学习
摘要
我们开发了 ImageNet-Think,一个为开发具备显式推理能力的视觉语言模型 (VLM) 而设计的多模态推理数据集。该数据集基于 ImageNet21k 数据集中的 25 万张图片构建,提供结构化思考标记和相应的答案。我们的合成数据集由两个最先进的 VLM 生成:GLM-4.1V-9B-Thinking 和 Kimi-VL-A3B-Thinking-2506。每张图片都伴随两对思考-答案序列,为训练和评估多模态推理模型提供资源。我们捕捉了 VLM 的逐步推理过程及最终描述性答案。我们希望通过该数据集,促进更稳健的 VLM 开发,同时为更广泛的多模态推理机制理解做出贡献。该数据集和评估基准将对外公开,以助力推理/思考类 VLM 研究。
引用
@article{arxiv.2510.01582,
title = {ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models},
author = {Krishna Teja Chitty-Venkata and Murali Emani},
journal= {arXiv preprint arXiv:2510.01582},
year = {2025}
}
备注
Preprint