ChartFormer:将图表图像转换为触觉可访问SVG的大型视觉语言模型
计算机视觉与模式识别
2024-05-30 v1
摘要
可视化(如图表)对于解释复杂数据至关重要。然而,它们通常以光栅图像形式提供,无法与盲人和视障人士的辅助技术(如盲文纸或触觉显示器)兼容。同时,创建可访问的矢量图形需要熟练的明眼人且耗时。在这项工作中,我们利用图表分析领域的进展,以端到端方式生成触觉图表。我们的三个关键贡献如下:(1)引入ChartFormer模型,训练将光栅图表图像转换为触觉可访问的SVG;(2)在Chart2Tactile数据集上训练该模型,该数据集是我们按照无障碍标准创建的合成图表数据集;(3)通过使用可刷新二维触觉显示器的试点用户研究评估我们SVG的有效性。我们的工作公开于https://github.com/nsothman/ChartFormer。
引用
@article{arxiv.2405.19117,
title = {ChartFormer: A Large Vision Language Model for Converting Chart Images into Tactile Accessible SVGs},
author = {Omar Moured and Sara Alzalabny and Anas Osman and Thorsten Schwarz and Karin Muller and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2405.19117},
year = {2024}
}
备注
Accepted at ICCHP 2024. Codes will be available at https://github.com/nsothman/ChartFormer