TP2O:基于平衡交换采样的创造性文本对到物体生成
计算机视觉与模式识别
2024-07-19 v4
摘要
从两个看似无关的物体文本生成创造性组合物体是文本到图像合成中的一项挑战性任务,常受限于对现有数据分布的模仿。本文中,我们开发了一种简洁而高效的方法,称为\textbf{平衡交换采样}。首先,我们提出一种交换机制,通过前沿的扩散模型随机交换两个文本嵌入的内在元素,生成新颖的组合物体图像集。其次,我们引入平衡交换区域,通过平衡新图像与其原始生成之间的 CLIP 距离,从新生成的图像集中高效采样一个小子集,从而提高接受高质量组合的可能性。最后,我们采用分割方法比较分割组件间的 CLIP 距离,最终从采样子集中选出最有前景的物体。大量实验表明,我们的方法优于近期 SOTA 的 T2I 方法。令人惊讶的是,我们的结果甚至可与人类艺术家(如 frog-broccoli)相媲美。
引用
@article{arxiv.2310.01819,
title = {TP2O: Creative Text Pair-to-Object Generation using Balance Swap-Sampling},
author = {Jun Li and Zedong Zhang and Jian Yang},
journal= {arXiv preprint arXiv:2310.01819},
year = {2024}
}
备注
Accepted by ECCV2024, Project page: https://njustzandyz.github.io/tp2o/