中文

视角计数:利用观察者反馈构建符合盲人及低视力用户需求的图表描述数据集

人工智能 2025-03-18 v1 计算机视觉与模式识别 人机交互

摘要

通常,标注团队的需求和视力能力与终端用户团队不同。为盲人及低视力(BLV)用户生成详细图表描述是这样一个具有挑战性的领域。虽然观察者可以轻松描述视觉内容,但已有研究表明,他们直接生成的描述成本高昂、容易受偏见影响,且在BLV标准方面存在不足。本研究询问观察者——而非生成——来自受监督的多路径推理指导下的视觉语言模型(VLM)生成的图表描述。观察者的评估在专业教育者(他们本身是BLV)身上被证明有效且有用,这些教育者教授视力受损的学生。我们发布了Sightation,一套图表描述数据集,涵盖5000个图表和137000个样本,用于完成、偏好、检索、问答和推理训练目的,并展示了其在各种下游任务中的微调潜力。

关键词

引用

@article{arxiv.2503.13369,
  title  = {Sightation Counts: Leveraging Sighted User Feedback in Building a BLV-aligned Dataset of Diagram Descriptions},
  author = {Wan Ju Kang and Eunki Kim and Na Min An and Sangryul Kim and Haemin Choi and Ki Hoon Kwak and James Thorne},
  journal= {arXiv preprint arXiv:2503.13369},
  year   = {2025}
}

备注

37 pages, 10 figures, 21 tables