中文

五美元模型:从句子嵌入生成游戏地图与精灵图

机器学习 2023-08-09 v1 计算与语言 计算机视觉与模式识别

摘要

五美元模型是一种轻量级文本到图像生成架构,可从编码的文本提示生成低维图像。该模型能够在低维领域中以有限的训练数据量成功生成准确且美观的内容。尽管模型和数据集的规模都很小,生成的图像仍能够保持文本提示的编码语义含义。我们将该模型应用于三个小数据集:像素艺术视频游戏地图、视频游戏精灵图像和降尺度表情符号图像,并应用新颖的增强策略来提升模型在这些有限数据集上的性能。我们使用 CLIP VIT-B/32 模型生成的文本-图像对之间的余弦相似度分数来评估模型的性能。

关键词

引用

@article{arxiv.2308.04052,
  title  = {The Five-Dollar Model: Generating Game Maps and Sprites from Sentence Embeddings},
  author = {Timothy Merino and Roman Negri and Dipika Rajesh and M Charity and Julian Togelius},
  journal= {arXiv preprint arXiv:2308.04052},
  year   = {2023}
}

备注

to be published in AIIDE 2023