中文

基于数字孪生表示的文本驱动推理视频编辑强化学习

计算机视觉与模式识别 2025-11-19 v1

摘要

文本驱动视频编辑允许用户仅通过文本查询修改视频内容。虽然现有方法可在提供明确的编辑目标及其精确空间位置和时间边界的描述后修改视频内容,但这些要求在用户尝试通过隐式查询引用语义属性或对象关系来概念化编辑时变得不切实际。我们提出推理视频编辑任务,即视频编辑模型必须通过多跳推理解释隐式查询,以推断编辑目标后再执行修改,首个尝试解决此复杂问题的模型为 RIVER (Reasoning-based Implicit Video Editor)。RIVER 通过数字孪生表示将推理与生成解耦,视频内容的数字孪生表示保留了空间关系、时间轨迹和语义属性。随后,大型语言模型联合处理该表示与隐式查询,进行多跳推理以确定修改,然后输出结构化指令以指导扩散式编辑器执行像素级更改。RIVER 的训练使用强化学习,奖励评估推理准确性和生成质量。最后,我们引入 RVEBenchmark,该基准包含 100 个视频和 519 个隐式查询,覆盖三种推理复杂度级别和类别,专为推理视频编辑设计。RIVER 在提出的 RVEBenchmark 上实现最佳性能,也在两个额外视频编辑基准 (VegGIE 和 FiVE) 上实现 SOTA,超越六个基线方法。

关键词

引用

@article{arxiv.2511.14100,
  title  = {Text-Driven Reasoning Video Editing via Reinforcement Learning on Digital Twin Representations},
  author = {Yiqing Shen and Chenjia Li and Mathias Unberath},
  journal= {arXiv preprint arXiv:2511.14100},
  year   = {2025}
}