中文

VisText:面向语义丰富图表描述生成的基准

计算机视觉与模式识别 2023-07-12 v1 人机交互 机器学习

摘要

描述或解释图表的说明文字有助于提升对所描绘数据的回忆与理解,并为视觉障碍人群提供更易获取的途径。然而,当前自动生成此类说明文字的方法难以清晰表达作为图表特征的感知或认知特征(例如复杂趋势与模式)。对此,我们引入VisText:一个包含12,441对图表与说明文字的数据集,这些说明文字描述了图表的构建、报告关键统计信息,并识别感知与认知现象。在VisText中,图表以三种表示形式提供:光栅化图像、底层数据表与场景图——一种类似于网页文档对象模型(DOM)的图表视觉元素层次化表示。为评估VisText的影响,我们在图表描述任务上微调最先进语言模型,并应用前缀微调以生成语义内容各异的说明文字。我们的模型生成连贯、语义丰富的说明文字,并在机器翻译与文本生成指标上与最先进图表描述模型表现相当。通过定性分析,我们识别出模型所犯六类广泛错误,可为未来工作提供指引。

关键词

引用

@article{arxiv.2307.05356,
  title  = {VisText: A Benchmark for Semantically Rich Chart Captioning},
  author = {Benny J. Tang and Angie Boggust and Arvind Satyanarayan},
  journal= {arXiv preprint arXiv:2307.05356},
  year   = {2023}
}

备注

Published at ACL 2023, 29 pages, 10 figures