中文

EVLM:面向跨维度视觉编辑的自反思多模态推理

计算机视觉与模式识别 2025-11-11 v2

摘要

根据模糊或部分指定的指令编辑复杂视觉内容仍然是视觉-语言建模中的核心挑战。现有模型能够对内容进行语境化处理,但往往无法推断参考图像或场景中的潜在意图,导致编辑结果不一致或错位。我们引入了视觉-语言编辑模型(EVLM),该系统将模糊指令与参考视觉内容结合解释,以生成精确、具备语境感知的编辑提示。EVLM 的关键创新在于一个反思推理框架,该框架通过反思感知 KL 散度目标优化(RKTO)与人类评分的依据对齐,将主观用户意图转化为结构化、可执行的输出。通过将思维链(CoT)推理与 RKTO 对齐相结合,EVLM 能够在不依赖二元监督的情况下捕捉细粒度的编辑偏好。EVLM 在包含 30,000 个带有人工标注依据质量的 CoT 示例数据集上进行了训练,在与人类意图的对齐方面取得了显著提升。在图像、视频、3D 和 4D 编辑任务上的实验表明,EVLM 能够生成连贯且高质量的指令,为多模态编辑与推理提供了可扩展的基础。

关键词

引用

@article{arxiv.2412.10566,
  title  = {EVLM: Self-Reflective Multimodal Reasoning for Cross-Dimensional Visual Editing},
  author = {Umar Khalid and Kashif Munir and Hasan Iqbal and Azib Farooq and Jing Hua and Nazanin Rahnavard and Chen Chen and Victor Zhu and Zhengping Ji},
  journal= {arXiv preprint arXiv:2412.10566},
  year   = {2025}
}

备注

Technical Report