面向可控视频生成的 reason-then-describe 指令解释器
计算机视觉与模式识别
2025-11-26 v1
摘要
扩散 Transformer 显著�地提高了视频的视觉保真度和时序一致性,但实际可控性仍有限。简洁、模糊且组合复杂的用户输入与训练中使用的详细提示之间存在差距,导致意图-输出不匹配。我们提出 ReaDe,一个通用且模型无关的解释器,将原始指令转换为精确、可操作的规格,以供下游视频生成器使用。ReaDe 遵循 reason-then-describe 范式:它首先分析用户请求以识别核心要求并消除歧义,然后生成详细的指导,从而实现可靠、可控的生成。我们通过两个阶段的优化来训练 ReaDe:(i) 推理增强的监督赋予分析性解析以分步追踪和密集描述,(ii) 多维奖励分配器实现基于反馈的稳定、自然风格描述的细化。在单条件和多条件情景下的实验表明,ReaDe 在指令保真度、描述准确性和下游视频质量方面 consistently 实现提升,并在推理密集型和未见输入上表现出强大的泛化能力。ReaDe 为将可控视频生成与准确解释用户意图相结合提供了实用途径。项目页面: https://sqwu.top/ReaDe/。
引用
@article{arxiv.2511.20563,
title = {A Reason-then-Describe Instruction Interpreter for Controllable Video Generation},
author = {Shengqiong Wu and Weicai Ye and Yuanxing Zhang and Jiahao Wang and Quande Liu and Xintao Wang and Pengfei Wan and Kun Gai and Hao Fei and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2511.20563},
year = {2025}
}
备注
27 pages, 13 figures, 13 tables, Project Page: https://sqwu.top/ReaDe/