中文

基于提示优化和测试时扩展的文本到视频生成的检索、精炼与排序

计算机视觉与模式识别 2026-03-03 v1 人工智能

摘要

虽然大规模数据集推动了文本到视频(T2V)生成模型取得显著进展,但这些模型对输入提示高度敏感,表明提示设计对生成质量至关重要。当前改进视频输出的方法往往力不足:要么依赖复杂的后编辑模型,风险引入人工物;要么需要对核心生成器进行高昂的微调,这严重限制了可扩展性和可及性。本文引入3R,一种新颖的基于检索增强生成(RAG)的提示优化框架。3R利用当前最先进的T2V扩散模型和视觉语言模型的强大功能,可与任何T2V模型无缝集成,无需任何模型训练。该框架利用三个关键策略:基于RAG的修饰符提取以实现更丰富的上下文 grounding,基于扩散的偏好优化以将输出与人类偏好对齐,以及时序帧插值以产生一致的时序视觉内容。这些组件共同实现了更准确、更高效且更具上下文对齐的文本到视频生成。实验结果表明,3R在提升生成视频的静态保真度和动态连贯性方面有效,凸显了优化用户提示的重要性。

关键词

引用

@article{arxiv.2603.01509,
  title  = {Retrieval, Refinement, and Ranking for Text-to-Video Generation via Prompt Optimization and Test-Time Scaling},
  author = {Zillur Rahman and Alex Sheng and Cristian Meo},
  journal= {arXiv preprint arXiv:2603.01509},
  year   = {2026}
}

备注

2026 ICLR TTU Workshop