魔鬼藏在提示词中:基于检索增强的文本到视频生成提示优化框架
计算机视觉与模式识别
2025-05-07 v2 计算与语言
摘要
文本到视频(T2V)生成模型的演进历经显著进展,这些模型在大规模数据集上进行训练。然而,T2V 生成模型对输入提示词的敏感性凸显了提示词设计在影响生成结果方面的关键作用。以往的研究主要依赖大型语言模型(LLM)将用户提供的提示词与训练提示词的分布对齐,却未考虑提示词词汇和句子结构细微差异。为此,我们引入了 RAPO,即检索增强提示优化框架。为解决 LLM 生成的提示词可能存在的不准确和模糊细节问题,RAPO 通过两个优化分支细化粗糙的提示词,从中挑选出更适合用于 T2V 生成的提示词。第一个分支从学习到的关系图中提取多样化修饰词,扩充用户提示词,并通过微调的 LLM 将其对齐到训练提示词的格式。相反,第二个分支遵循一套明确定义的指令,使用预训练 LLM 重写粗糙的提示词。广泛的实验表明,RAPO 能够有效提升生成视频的静态和动态维度,证明了针对用户提供的提示词进行优化的重要性。
引用
@article{arxiv.2504.11739,
title = {The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation},
author = {Bingjie Gao and Xinyu Gao and Xiaoxue Wu and Yujie Zhou and Yu Qiao and Li Niu and Xinyuan Chen and Yaohui Wang},
journal= {arXiv preprint arXiv:2504.11739},
year = {2025}
}
备注
accepted by CVPR2025, Project website: https://whynothaha.github.io/Prompt_optimizer/RAPO.html