通过多视觉策略引导的强化学习生成高收益NFT图像扩散
计算机视觉与模式识别
2023-08-21 v2
摘要
我们研究从用户输入文本生成高收益非同质化代币(Non-Fungible Token, NFT)图像的任务。扩散模型近期的进展在图像生成方面展现出巨大潜力。然而,现有工作难以生成视觉上令人愉悦且高收益的NFT图像,主要由于缺乏:1)针对NFT图像丰富且细粒度的视觉属性提示,以及2)用于生成高质量NFT图像的有效优化指标。为解决这些挑战,我们提出了一种以多视觉策略作为奖励的基于扩散的生成框架(即Diffusion-MVP),用于NFT图像。该框架由大语言模型(LLM)、基于扩散的图像生成器以及一系列精心设计的视觉奖励组成。首先,LLM通过生成包含特定视觉属性(如“忍者风格且绿色背景的熊猫”)的更全面的NFT风格提示来增强基础人类输入(如“熊猫”)。其次,基于扩散的图像生成器使用大规模NFT数据集进行微调,以捕捉流行NFT元素的细粒度图像风格与配饰组合。第三,我们进一步提出利用多视觉策略作为优化目标,包括视觉稀有度等级、视觉美学分数以及基于CLIP的文本-图像相关性。该设计确保我们提出的Diffusion-MVP能够铸造具有高视觉质量与市场价值的NFT图像。为促进本研究,我们收集了迄今为止最大的公开可用NFT图像数据集,包含150万张高质量图像及其对应文本与市场价值。包括客观评估与用户研究在内的广泛实验表明,与SOTA方法相比,我们的框架能生成具有更强视觉吸引力元素与更高市场价值的NFT图像。
引用
@article{arxiv.2306.11731,
title = {Learning Profitable NFT Image Diffusions via Multiple Visual-Policy Guided Reinforcement Learning},
author = {Huiguo He and Tianfu Wang and Huan Yang and Jianlong Fu and Nicholas Jing Yuan and Jian Yin and Hongyang Chao and Qi Zhang},
journal= {arXiv preprint arXiv:2306.11731},
year = {2023}
}
备注
Accepted by ACM-MM 2023