中文

CoMM:用于多模态理解和生成的连贯交错图像文本数据集

计算机视觉与模式识别 2025-04-03 v3

摘要

图像文本交错生成已成为一种关键的多模态任务,旨在给定查询条件下生成一系列交错的视觉和文本内容。尽管近期的多模态大语言模型 (MLLMs) 在该领域取得了显著进展,但生成具有叙事连贯性、实体和风格一致性的综合图像文本序列仍具有挑战性,这源于训练数据质量较差。为此,我们引入 CoMM——一个高质量的连贯交错图像文本多模态数据集,以增强生成多模态内容的连贯性、一致性和对齐性。首先,CoMM 利用来自多种来源的原始数据,聚焦于指令内容和视觉叙事,建立连贯且一致的内容基础。为进一步提升数据质量,我们设计了一种多视角过滤策略,利用先进的预训练模型确保句子生成、插入图像的一致性以及它们之间的语义对齐。设计了各种质量评估指标,以证明过滤后数据集的高质量。同时,针对各种下游任务进行大量零样本实验,表明 CoMM 在显著提升 MLLMs 的情境学习能力方面效果显著。此外,我们提出了四个新任务来评估 MLLMs 的交错生成能力,并构建了全面的评估框架。我们认为 CoMM 为具有优越多模态情境学习和理解能力的先进 MLLMs 开辟了新的道路。

关键词

引用

@article{arxiv.2406.10462,
  title  = {CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation},
  author = {Wei Chen and Lin Li and Yongqi Yang and Bin Wen and Fan Yang and Tingting Gao and Yu Wu and Long Chen},
  journal= {arXiv preprint arXiv:2406.10462},
  year   = {2025}
}

备注

22 pages, Accepted by CVPR 2025