中文

多模态检索增强多模态生成:数据集、评估指标与强基线

计算与语言 2025-05-26 v4

摘要

我们系统性地调查了多模态检索增强多模态生成(M2^2RAG),这是一种新型任务,使基础模型能够处理多模态网页内容并生成多模态响应,具有更好的信息密度和可读性。尽管其潜在影响巨大,但M2^2RAG仍未得到充分研究,缺乏全面的分析和高质量的数据资源。为弥补这一差距,我们通过严格的数据 curated 流程建立了全面的基准,并采用基于基础模型的文本-模态指标和多模态指标进行评估。我们进一步提出了若干策略,使基础模型能够有效地处理M2^2RAG任务,并通过我们设计的指标筛选高质量样本构建训练集。我们的大量实验表明,我们提出的指标可靠,展示了我们设计的策略下模型性能的格局,并表明我们微调的7B-8B模型超过GPT-4o模型,接近最新的OpenAI o3-mini。此外,我们在不同领域进行了细粒度分析,验证了我们在数据 curated 流程中的有效性。所有资源,包括代码、数据集和模型权重,都将公开发布。

关键词

引用

@article{arxiv.2411.16365,
  title  = {Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines},
  author = {Zi-Ao Ma and Tian Lan and Rong-Cheng Tu and Yong Hu and Yu-Shi Zhu and Tong Zhang and Heyan Huang and Zhijing Wu and Xian-Ling Mao},
  journal= {arXiv preprint arXiv:2411.16365},
  year   = {2025}
}