中文

WEAVE:解放并基准测试情境交叉式理解与生成

计算机视觉与模式识别 2025-11-17 v1

摘要

近期统一多模态模型(Unified Multimodal Models, UMMs)的进展推动了视觉理解与生成的显著进展。然而,现有数据集和基准测试主要聚焦于单轮交互,未能捕捉现实场景中图像创建和编辑的多轮、情境依赖性。为填补这一空白,我们提出WEAVE——首个用于情境交叉式理解与生成的套件。该套件包含两个互补部分。WEAVE-100k是一个规模为10万个交叉样本的数据集,涵盖37万余个对话轮次和50万余张图像,涉及需要对历史情境进行推理的理解、编辑和生成任务。WEAVEBench是一个由人工标注的基准测试,包含100个任务,基于480张图像,采用混合VLM评估框架(基于参考图像以及原始图像与编辑指令的组合),评估模型在多轮生成、视觉记忆和世界知识推理方面的能力,涵盖多个领域。实验表明,在WEAVE-100k上进行训练可使模型具备视觉理解、图像编辑和理解-生成协作能力。此外,它促进了UMMs发展出涌现的视觉记忆能力,而对WEAVEBench的广泛评估则暴露了当前方法在多轮、情境感知图像生成和编辑方面的持久局限与挑战。我们认为WEAVE为多模态社区研究情境交叉式理解与生成提供了视角与基础。

关键词

引用

@article{arxiv.2511.11434,
  title  = {WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation},
  author = {Wei Chow and Jiachun Pan and Yongyuan Liang and Mingze Zhou and Xue Song and Liyu Jia and Saining Zhang and Siliang Tang and Juncheng Li and Fengda Zhang and Weijia Wu and Hanwang Zhang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2511.11434},
  year   = {2025}
}