中文

上下文对无障碍图像描述至关重要:无参考评测指标面临的挑战

计算与语言 2022-10-31 v2

摘要

网络上极少有图像配有可使盲人和低视力(BLV)用户无障碍获取的替代文本(alt-text)描述。基于图像的自然语言生成(NLG)系统已取得进展,足以开始解决这一长期存在的社会问题,但除非我们依据能正确引导其开发的指标对其加以评测,否则这些系统不会完全成功。在此,我们反对当前的无参考指标——即不依赖人工生成的真实描述的指标——理由是其与 BLV 用户的需求不一致。这些指标的根本缺陷在于未考虑上下文,而上下文信息深受 BLV 用户重视。为证实这些主张,我们开展了一项由 BLV 参与者沿多个维度对描述进行评分的研究。深入分析揭示,缺乏上下文感知使当前无参考指标不足以推进图像无障碍。作为概念验证,我们提供了无参考指标 CLIPScore 的上下文感知版本,开始弥合与 BLV 数据之间的脱节。本文的无障碍 HTML 版本可在 https://elisakreiss.github.io/contextual-description-evaluation/paper/reflessmetrics.html 获取。

关键词

引用

@article{arxiv.2205.10646,
  title  = {Context Matters for Image Descriptions for Accessibility: Challenges for Referenceless Evaluation Metrics},
  author = {Elisa Kreiss and Cynthia Bennett and Shayan Hooshmand and Eric Zelikman and Meredith Ringel Morris and Christopher Potts},
  journal= {arXiv preprint arXiv:2205.10646},
  year   = {2022}
}

备注

Proceedings of EMNLP 2022