中文

GenAssist:让图像生成无障碍化

人机交互 2023-07-24 v1

摘要

盲人和低视力(BLV)创作者使用图像与视力正常受众交流。然而,创作或检索图像对 BLV 创作者而言十分困难,因为他们难以使用创作工具或评估图像搜索结果。因此,创作者限制了所创作图像的类型,或求助于视力正常的协作者。虽然文本到图像生成模型让创作者能基于文本描述(即提示词)生成高保真图像,但评估生成图像的内容与质量仍然困难。我们提出 GenAssist,一个使文本到图像生成无障碍化的系统。通过我们的界面,创作者可验证生成的图像候选是否遵循提示词、获取图像中未由提示词指定的额外细节,并浏览图像候选间相似性与差异的摘要。为驱动该界面,GenAssist 使用大语言模型生成视觉问题、视觉-语言模型提取答案,以及大语言模型总结结果。我们对 12 名 BLV 创作者开展的研究表明,GenAssist 赋能并简化了图像选择与生成过程,使视觉创作对所有人更可及。

关键词

引用

@article{arxiv.2307.07589,
  title  = {GenAssist: Making Image Generation Accessible},
  author = {Mina Huh and Yi-Hao Peng and Amy Pavel},
  journal= {arXiv preprint arXiv:2307.07589},
  year   = {2023}
}

备注

For accessibility tagged pdf, please refer to the ancillary file