Zebra-CoT:用于交错视觉语言推理的数据集
计算机视觉与模式识别
2025-10-10 v2 计算与语言
机器学习
摘要
人类在解决复杂问题时常常会使用视觉辅助工具,例如图表或草图。训练多模态模型执行相同操作(称为视觉链思维,Visual CoT)由于存在挑战:(1)现有的视觉 CoT 性能较差,这会阻碍强化学习,且(2)缺乏高质量的视觉 CoT 训练数据。我们引入了 ,一个包含 182,384 个样本的大型多样化数据集,包含逻辑连贯的交错文本-图像推理痕迹。我们聚焦于四类任务,其中绘图或视觉推理尤其自然,涵盖科学问题,如几何、物理和算法;2D 视觉推理任务,如视觉搜索和拼图;3D 推理任务,包括 3D 多跳推理、具身化和机器人规划;视觉逻辑问题和战略游戏,如象棋。在 Zebra-CoT 训练语料库上微调 Anole-7B 模型,可使测试集准确率提高 12%,在标准 VLM 基准评估中实现最高 13% 的性能提升。微调 Bagel-7B 可生成高质量的交错视觉推理链,凸显 Zebra-CoT 在开发多模态推理能力方面的有效性。我们开源数据集和模型,以支持视觉 CoT 的开发和评估。
引用
@article{arxiv.2507.16746,
title = {Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning},
author = {Ang Li and Charles Wang and Deqing Fu and Kaiyu Yue and Zikui Cai and Wang Bill Zhu and Ollie Liu and Peng Guo and Willie Neiswanger and Furong Huang and Tom Goldstein and Micah Goldblum},
journal= {arXiv preprint arXiv:2507.16746},
year = {2025}
}
备注
dataset link: https://huggingface.co/datasets/multimodal-reasoning-lab/Zebra-CoT