中文

InstructX:基于 MLLM 指导的统一视觉编辑框架

计算机视觉与模式识别 2025-10-10 v1

摘要

随着多模态大语言模型(MLLM)在视觉理解与推理方面取得进展,越来越多人关注利用它们来提高扩散模型的编辑性能。尽管取得了快速进展,但大多数研究缺乏对 MLLM 设计选择的深入分析。此外,MLLM 与扩散模型的集成在某些困难任务(如视频编辑)中仍是开放挑战。本文提出 InstructX,一个用于图像和视频编辑的统一框架。具体而言,我们对 MLLM 与扩散模型在指令驱动编辑中的集成进行了全面研究。基于此研究,我们分析了图像和视频在统一建模中的合作与区别。(1)我们表明,在图像数据上进行训练可导致无需显式监督即可展现视频编辑能力,从而缓解了稀缺视频训练数据所致的限制。(2)通过融合特定于模态的 MLLM 特征,我们的方法在单个模型中有效统一了图像和视频编辑任务。广泛的实验表明,我们的方法能够处理广泛的图像和视频编辑任务,并实现了业界最佳性能。

关键词

引用

@article{arxiv.2510.08485,
  title  = {InstructX: Towards Unified Visual Editing with MLLM Guidance},
  author = {Chong Mou and Qichao Sun and Yanze Wu and Pengze Zhang and Xinghui Li and Fulong Ye and Songtao Zhao and Qian He},
  journal= {arXiv preprint arXiv:2510.08485},
  year   = {2025}
}