Gaudí:与深度表征的对话式交互以生成图像集合
人工智能
2021-12-09 v1 信息检索
机器学习
摘要
基于近期在逼真语言建模(GPT-3)和跨模态表征(CLIP)方面的进展,我们开发了Gaudí,旨在帮助设计师使用自然语言搜索灵感图像。在设计过程的早期阶段,为了引导客户偏好的创意方向,设计师通常会创建称为“情绪板”的主题性灵感图像集合。创建情绪板涉及顺序的图像搜索,目前通过关键词或图像进行。Gaudí将这一过程转变为一种对话,用户在其中逐步细化情绪板的主题。这种表征使我们的AI能够从零开始,直接从项目简报出发,遵循GPT-3假设的主题生成新的搜索查询。与以往创建情绪板的计算方法相比,据我们所知,我们的工作是首次尝试将情绪板表征为设计师在向客户展示创意方向时所讲述的故事。
引用
@article{arxiv.2112.04404,
title = {Gaud\'i: Conversational Interactions with Deep Representations to Generate Image Collections},
author = {Victor S. Bursztyn and Jennifer Healey and Vishwa Vinay},
journal= {arXiv preprint arXiv:2112.04404},
year = {2021}
}
备注
Accepted at the NeurIPS 2021 Workshop on Machine Learning for Creativity and Design