中文

ChartFormer:将图表图像转换为触觉可访问SVG的大型视觉语言模型

计算机视觉与模式识别 2024-05-30 v1

摘要

可视化(如图表)对于解释复杂数据至关重要。然而,它们通常以光栅图像形式提供,无法与盲人和视障人士的辅助技术(如盲文纸或触觉显示器)兼容。同时,创建可访问的矢量图形需要熟练的明眼人且耗时。在这项工作中,我们利用图表分析领域的进展,以端到端方式生成触觉图表。我们的三个关键贡献如下:(1)引入ChartFormer模型,训练将光栅图表图像转换为触觉可访问的SVG;(2)在Chart2Tactile数据集上训练该模型,该数据集是我们按照无障碍标准创建的合成图表数据集;(3)通过使用可刷新二维触觉显示器的试点用户研究评估我们SVG的有效性。我们的工作公开于https://github.com/nsothman/ChartFormer。

关键词

引用

@article{arxiv.2405.19117,
  title  = {ChartFormer: A Large Vision Language Model for Converting Chart Images into Tactile Accessible SVGs},
  author = {Omar Moured and Sara Alzalabny and Anas Osman and Thorsten Schwarz and Karin Muller and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2405.19117},
  year   = {2024}
}

备注

Accepted at ICCHP 2024. Codes will be available at https://github.com/nsothman/ChartFormer