POET:通过自动扩展支持文本到图像生成的提示创意与个性化
计算机视觉与模式识别
2025-09-05 v2 人机交互
摘要
领先的视觉生成 AI 工具在为创意任务的用户提供早期构思阶段的帮助方面发挥着巨大的潜力——提供能够生成(而不是搜索)相当质量的全新(而非已有)图像的能力,这些图像还能遵循用户规范的无限组合。然而,许多大规模文本到图像系统设计用于广泛适用性,产生常规输出,可能限制创意探索。它们还采用可能对初学者不友好的交互方式。鉴于创意最终用户往往以多样化、特定于情境的方式运行,且往往难以预测,需要更多变和个性化。我们引入 POET,一个实时交互工具, (1) 自动发现文本到图像生成模型中的同质性维度, (2) 将这些维度扩展以多样化生成图像的输出空间, (3) 从用户反馈中学习以实现个性化扩展。通过 28 名用户跨越四个创意任务领域的评估表明,POET 能够生成更高感知多样性的结果,并帮助用户在创意任务中更少的提示次数就满足需求,从而促使他们在更广泛的可能生成结果范围内进行思考和反思。聚焦视觉创意,POET 提供了未来文本到图像生成工具交互技术可能如何支持并与最终用户更广泛样本价值观和需求相匹配的初步 glimpse。
引用
@article{arxiv.2504.13392,
title = {POET: Supporting Prompting Creativity and Personalization with Automated Expansion of Text-to-Image Generation},
author = {Evans Xu Han and Alice Qian Zhang and Haiyi Zhu and Hong Shen and Paul Pu Liang and Jane Hsieh},
journal= {arXiv preprint arXiv:2504.13392},
year = {2025}
}