FlipVQA:基于教科书到知识综合的多模态指令调优扩展
人工智能
2026-03-31 v2 机器学习
摘要
教科书是人类验证推理知识最丰富的储存库,但其复杂布局包含多列排版、跨页问答分离和交错图表,使从自动化提取结构化QA和VQA对 extremely具有挑战。现有方法要么从头综合数据,缺乏真实问题情境;要么依赖高成本专家标注难以规模化。我们提出FlipVQA-Miner,一个自动化管道,解决OCR解析文档中的长程逻辑依赖和跨页连续性问题,即使答案位于separate companion volumes中,也能恢复连贯的question--answer--figure关联。随后,多阶段精选管道将这些原始提取转化为AI就绪的监督信号。使用FlipVQA-Miner,我们构建了FlipVQA-83K,包含83K个QA和VQA对,覆盖11个学科领域,相较于手动标注实现50倍成本节省,同时保持高结构保真度(F1 > 0.96)。在FlipVQA-83K上微调的模型在推理能力和跨域泛化方面表现显著提升,建立了以人类知识为基础的数据 curated 可扩展范式。本数据集及完整的数据生成与 curated 方法可在https://github.com/OpenDCAI/DataFlow-VQA 查看。
引用
@article{arxiv.2511.16216,
title = {FlipVQA: Scaling Multi-modal Instruction Tuning via Textbook-to-Knowledge Synthesis},
author = {Zhen Hao Wong and Jingwen Deng and Yuzhao Wang and Wenkai Yu and Jihao Huang and Runming He and Chengyu Shen and Hao Liang and Wentao Zhang},
journal= {arXiv preprint arXiv:2511.16216},
year = {2026}
}