基于大语言模型构建的日语合成流程图视觉问答数据集
计算机视觉与模式识别
2026-02-06 v2 人工智能
摘要
视觉语言模型 (VLM) 有望通过问答 (QA) 界面分析复杂文档, 例如包含流程图的文档. 由于它们提供了文本唯一解释难以获取的宝贵见解, 对流程图识别与解释能力的需求日益增长. 然而, 开发具备精确流程图理解能力的 VLM 需要大规模流程图图像及其对应文本的数据集, 而数据集的创建工作负担巨大. 为此, 我们引入 JSynFlow, 一个使用大语言模型 (LLM) 生成的日语流程图综合视觉 QA 数据集. 本数据集包含各种业务职业的任务描述、由领域特定语言 (DSL) 代码渲染而来的相应流程图图像, 以及相关 QA 对. 本文详细阐述了数据集的合成过程, 并演示了通过 JSynFlow 微调显著提高了 VLM 在流程图基于 QA 任务上的性能. 本数据集已公开于 https://huggingface.co/datasets/jri-advtechlab/jsynflow.
引用
@article{arxiv.2602.04142,
title = {JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models},
author = {Hiroshi Sasaki},
journal= {arXiv preprint arXiv:2602.04142},
year = {2026}
}
备注
7 pages, 1 figure