SynChart:基于语言模型合成图表
人工智能
2024-09-26 v1
摘要
随着 GPT-4V(O) 的发布,将其用于为多模态任务生成伪标签已获得显著普及。然而,如何从其基础大语言模型 (LLM) 构建此类先进模型仍是一个秘密。本工作探索了仅使用 LLM 进行数据生成的潜力,并开发了专注于图表理解的具有竞争力的多模态模型。我们构建了一个大规模图表数据集 SynChart,包含约 400 万张多样化图表图像和超过 7500 万条密集标注,包括数据表、代码、描述和问答集。我们使用该数据集训练了一个 4.2B 的图表专家模型,在 ChartQA 任务上取得了接近 GPT-4O 的性能,超越了 GPT-4V。
引用
@article{arxiv.2409.16517,
title = {SynChart: Synthesizing Charts from Language Models},
author = {Mengchen Liu and Qixiu Li and Dongdong Chen and Dong Chen and Jianmin Bao and Yunsheng Li},
journal= {arXiv preprint arXiv:2409.16517},
year = {2024}
}