POS:一种用于增强文本到视频生成的提示优化套件
计算机视觉与模式识别
2024-06-11 v3
摘要
本文旨在通过改进包括噪声与文本在内的两个输入提示来增强基于扩散的文本到视频生成。为此,我们提出 POS,一种无需训练的提示优化套件(Prompt Optimization Suite)以提升文本到视频模型。POS 的动机源于两点观察:(1)视频生成在噪声方面表现出不稳定性。给定相同文本,不同噪声会导致在帧质量与时间一致性方面差异显著的视频。该观察意味着每个文本输入都存在与之匹配的最优噪声;为捕捉潜在噪声,我们提出最优噪声近似器以逼近潜在最优噪声。具体而言,最优噪声近似器首先搜索与文本提示紧密相关的视频,随后将其反演至噪声空间,作为该文本输入的改进噪声提示。(2)通过 LLM 改进文本提示常引起语义偏离。许多现有的文本到视觉工作已利用 LLM 改进文本提示以增强生成。然而,现有方法常忽视原始文本与重写文本之间的语义对齐。针对此问题,我们设计语义保持重写器,在重写与去噪阶段均施加约束以保留语义一致性。在流行基准上的大量实验表明,我们的 POS 能以明显优势提升文本到视频模型。代码将开源。
引用
@article{arxiv.2311.00949,
title = {POS: A Prompts Optimization Suite for Augmenting Text-to-Video Generation},
author = {Shijie Ma and Huayi Xu and Mengjian Li and Weidong Geng and Yaxiong Wang and Meng Wang},
journal= {arXiv preprint arXiv:2311.00949},
year = {2024}
}