中文

通过微小调整使视频模型遵循用户意图

计算机视觉与模式识别 2026-03-23 v1

摘要

近期文本到视频扩散模型取得了显著进展,其生成控制引起了关注。通过边界框或布局是实现控制的常用方式。然而,强制遵循这些控制输入仍是开放问题。本文表明,通过稍微调整用户提供的边界框即可提高生成质量和对控制输入的遵循程度。这通过一种简单方法实现:优化边界框以更好地对齐视频扩散模型的内部注意力图,同时仔细平衡前景和背景的关注。在某种意义上,我们正在修改边界框,使其位于模型熟悉的地方。令人惊讶的是,我们发现即使进行小幅修改,生成质量也可能发生显著变化。为实现这一点,我们提出了一种平滑掩码,使边界框位置可微,并提出了一种注意力最大化目标用于改变边界框。我们进行了彻底的实验,包括用户研究,以验证我们方法的有效性。我们的代码已在项目网页上公开,以促进社区进行未来研究。

关键词

引用

@article{arxiv.2603.19672,
  title  = {Making Video Models Adhere to User Intent with Minor Adjustments},
  author = {Daniel Ajisafe and Eric Hedlin and Helge Rhodin and Kwang Moo Yi},
  journal= {arXiv preprint arXiv:2603.19672},
  year   = {2026}
}

备注

Project page and code: https://ubc-vision.github.io/MinorAdjustVideo/docs/webpage/index.html