中文

AskChart:通过文本增强实现通用图表理解

计算机视觉与模式识别 2024-12-30 v1 人工智能

摘要

图表理解任务如 ChartQA 和 Chart-to-Text 旨在自动从图表中提取和解释关键信息,使用户能够查询或将视觉数据转换为结构化格式。当前最先进的方法主要关注图表图像中的视觉线索,未能显式地整合图表中嵌入的丰富文本信息(如数据标签和坐标轴标签)。这种文本信息对于直观的人类理解和解释图表至关重要。此外,现有模型往往庞大且计算密集,限制了实际的应用。本文引入 AskChart,一个通用模型,通过混合专家(MoE)架构显式整合图表中的文本和视觉线索。AskChart 促进了图表视觉-文本表征的学习,以有效处理多种图表理解任务,同时保持较小的模型规模。为了捕捉视觉和文本模式之间的协同作用,我们策划了一个大型数据集,名为 ChartBank,包含约 750 万个数据样本,有助于对齐文本和视觉信息,并促进视觉实体和文本的提取。为了有效训练 AskChart,我们设计了一个三阶段训练策略,以对齐视觉和文本模式,学习鲁棒的视觉-文本表征,并优化 MoE 层的学习。在包括五个数据集在内的大量实验中,ShowChart 在四个图表理解任务中实现了显著的性能提升。值得注意的是,参数量为 46 亿的 AskChart 在 Open-ended ChartQA 和 Chart-to-Text 任务中分别比参数量为 130 亿的领先模型高出 68.3% 和 49.2%,而在 ChartQA 和 Chart-to-Table 任务中实现了可比的性能。

关键词

引用

@article{arxiv.2412.19146,
  title  = {AskChart: Universal Chart Understanding through Textual Enhancement},
  author = {Xudong Yang and Yifan Wu and Yizhang Zhu and Nan Tang and Yuyu Luo},
  journal= {arXiv preprint arXiv:2412.19146},
  year   = {2024}
}

备注

23 pages, 12 figures, 14 tables