中文

VINCIE:从视频中解锁情境图像编辑

计算机视觉与模式识别 2026-03-03 v2 人工智能 计算与语言 机器学习 多媒体

摘要

情境图像编辑旨在基于由文本和先前生成图像组成的情境序列来修改图像。现有方法通常依赖于任务特定的管道和专家模型(如分割和图像修复)来 curated 训练数据。在本工作中,我们探讨了是否可以从视频中直接学习情境图像编辑模型。我们提出了一种可扩展的视频标注方法,将其视为交错的多模态序列。为有效地从该数据中学习,我们设计了一个基于块因果扩散变换器的模型,在三个代理任务上进行训练:下一图像预测、当前分割预测和下一分割预测。此外,我们提出了一个新的多轮图像编辑基准,以推动该领域的研究。大量实验表明,我们的模型在情境图像编辑方面表现出色,在两个多轮图像编辑基准上实现了最先进的结果。尽管只在视频上训练, Our 模型在多概念组合、故事生成和链式编辑等应用方面也表现出良好的潜力。

关键词

引用

@article{arxiv.2506.10941,
  title  = {VINCIE: Unlocking In-context Image Editing from Video},
  author = {Leigang Qu and Feng Cheng and Ziyan Yang and Qi Zhao and Shanchuan Lin and Yichun Shi and Yicong Li and Wenjie Wang and Tat-Seng Chua and Lu Jiang},
  journal= {arXiv preprint arXiv:2506.10941},
  year   = {2026}
}

备注

ICLR 2026 Camera-ready. Project page: https://vincie2025.github.io/