中文

图像 speaks volumes:面向无障碍沟通的用户中心化图像生成评估

计算机视觉与模式识别 2024-10-07 v1 计算与语言

摘要

解释性图像在无障碍且易读(E2R)文本中发挥关键作用。然而,线上数据库中的图像并非针对各自文本进行定制,定制图像的创建成本高昂。本研究大规模调查了 text-to-image 生成模型是否能通过快速灵活地提供定制图像来弥合这一差距。我们对七个(四个开源、三个闭源)图像生成模型进行基准测试,并对生成图像进行详尽评估。此外,我们针对来自 E2R 目标群体的受试者进行用户研究,检验这些图像是否满足其需求。我们发现,一些模型表现突出,但没有模型可在规模化使用而无需人工监督。我们的研究是推动 E2R 创作者创建易访问信息、针对目标群体需求定制易访问图像的重要一步。

关键词

引用

@article{arxiv.2410.03430,
  title  = {Images Speak Volumes: User-Centric Assessment of Image Generation for Accessible Communication},
  author = {Miriam Anschütz and Tringa Sylaj and Georg Groh},
  journal= {arXiv preprint arXiv:2410.03430},
  year   = {2024}
}

备注

To be published at TSAR workshop 2024 (https://tsar-workshop.github.io/)