中文

FTII-Bench: 面向图文插入的流式文本综合多模态基准

计算机视觉与模式识别 2024-11-26 v2

摘要

得益于大语言模型 (LLM) 和基础视觉模型的革命性进展,大型视觉语言模型 (LVLM) 也取得了显著进步。然而,当前的基准测试侧重于评估 LVLM 单一能力的任务(例如,识别、检测、理解)。这些任务未能充分展示 LVLM 在复杂应用场景中的潜力。为全面评估现有 LVLM 的性能,我们提出了一个更具挑战性的任务,称为图文插入的流式文本任务 (FTII)。该任务要求 LVLM 同时具备出色的图像理解、指令理解和长文本解释能力。具体来说,给定若干文本段落和一组候选图像,随着文本段落的累积,LVLM 需要从候选中选择最合适的图像插入到相应段落之后。为此类任务构建基准极具挑战性,尤其是在确定流式文本和图像的顺序方面。为应对这一挑战,我们转向专业新闻报道,其天然包含了图文序列的金标准。基于此,我们引入了图文插入的流式文本基准 (FTII-Bench),包含 318 篇高质量中文图文新闻文章和 307 篇高质量英文图文新闻文章,涵盖 10 个不同的新闻领域。利用这 625 篇高质量文章,我们构建了两种不同类型、具有多个难度级别的问题。此外,我们基于 CLIP 模型和现有 LVLM 建立了两种不同的评估流程。我们评估了 9 个开源和 2 个闭源 LVLM 以及 2 个基于 CLIP 的模型。结果表明,即使是最先进的模型(例如 GPT-4o)在处理 FTII 任务时也面临重大挑战。

关键词

引用

@article{arxiv.2410.12564,
  title  = {FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion},
  author = {Jiacheng Ruan and Yebin Yang and Zehao Lin and Yuchen Feng and Feiyu Xiong and Zeyun Tang and Zhiyu Li},
  journal= {arXiv preprint arXiv:2410.12564},
  year   = {2024}
}

备注

Work in progress. 9 pages, 3 figures