GenAssist:让图像生成无障碍化
人机交互
2023-07-24 v1
摘要
盲人和低视力(BLV)创作者使用图像与视力正常受众交流。然而,创作或检索图像对 BLV 创作者而言十分困难,因为他们难以使用创作工具或评估图像搜索结果。因此,创作者限制了所创作图像的类型,或求助于视力正常的协作者。虽然文本到图像生成模型让创作者能基于文本描述(即提示词)生成高保真图像,但评估生成图像的内容与质量仍然困难。我们提出 GenAssist,一个使文本到图像生成无障碍化的系统。通过我们的界面,创作者可验证生成的图像候选是否遵循提示词、获取图像中未由提示词指定的额外细节,并浏览图像候选间相似性与差异的摘要。为驱动该界面,GenAssist 使用大语言模型生成视觉问题、视觉-语言模型提取答案,以及大语言模型总结结果。我们对 12 名 BLV 创作者开展的研究表明,GenAssist 赋能并简化了图像选择与生成过程,使视觉创作对所有人更可及。
引用
@article{arxiv.2307.07589,
title = {GenAssist: Making Image Generation Accessible},
author = {Mina Huh and Yi-Hao Peng and Amy Pavel},
journal= {arXiv preprint arXiv:2307.07589},
year = {2023}
}
备注
For accessibility tagged pdf, please refer to the ancillary file