中文

DreamOmni2:基于多模态指令的编辑与生成

计算机视觉与模式识别 2025-10-09 v1

摘要

近期在基于指令的图像编辑和主题驱动生成方面取得的进展引起了广泛关注,但两类任务仍存在无法满足实际用户需求的局限。基于指令的编辑仅依赖语言指令,往往难以捕获特定编辑细节,需依赖参考图像。而主题驱动生成仅限于组合具体物体或人物,忽略更广泛的抽象概念。为此,我们提出两种新任务:多模态指令式编辑与生成。这两种任务支持文本与图像指令,并将范围扩展至具体与抽象概念,大幅提升了实际应用价值。我们提出 DreamOmni2,主要面向数据创建与模型框架设计。我们的数据合成管线包含三个步骤:(1) 使用特征混合方法为抽象与具体概念创建提取数据,(2) 使用编辑与提取模型生成多模态指令式编辑训练数据,(3) 进一步应用提取模型创建多模态指令式编辑训练数据。对于框架,为处理多图像输入,我们提出一种索引编码和位置编码偏移方案,有助于模型区分图像并避免像素混淆。此外,我们引入与 VLM 及我们的生成/编辑模型联合训练,以更好地处理复杂指令。此外,我们提出了针对这两种新任务的全面基准测试以推动其发展。实验表明,DreamOmni2 取得了令人瞩目的成绩。模型和代码将公开释放。

关键词

引用

@article{arxiv.2510.06679,
  title  = {DreamOmni2: Multimodal Instruction-based Editing and Generation},
  author = {Bin Xia and Bohao Peng and Yuechen Zhang and Junjia Huang and Jiyang Liu and Jingyao Li and Haoru Tan and Sitong Wu and Chengyao Wang and Yitong Wang and Xinglong Wu and Bei Yu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2510.06679},
  year   = {2025}
}