中文

MultiBanana:多参考文本到图像生成的挑战性基准

计算机视觉与模式识别 2026-03-27 v2

摘要

近期文本到图像生成模型已具备多参考生成与编辑能力,即能够从多个参考图像中继承主体外观并在新情境中重新渲染。然而,现有基准数据集常聚焦于单一或少数参考图像的生成,无法衡量模型在大量参考图像指导下的性能或识别其弱点。此外,其任务定义仍模糊,仅限于'编辑什么'或'给定多少个参考图像'等维度,未能捕捉组合异构参考图像固有的挑战。为填补这一空白,我们引入MultiBanana,通过广泛覆盖多参考场景中特有的难题来评估模型能力边界:(1) varying the number of references(最多可达8个),(2) references之间领域不匹配(如照片与动漫),(3) reference与目标场景之间的尺度不匹配,(4) references包含稀有概念(如红香蕉),(5) 多语言文本参考用于渲染。我们在多种文本到图像模型中进行分析,揭示其各自的性能、典型失效模式及改进方向。MultiBanana以开放基准形式发布,以推动边界拓展并建立公平比较的标准化基础。我们的数据与代码已在 https://github.com/matsuolab/multibanana 上提供。

关键词

引用

@article{arxiv.2511.22989,
  title  = {MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation},
  author = {Yuta Oshima and Daiki Miyake and Kohsei Matsutani and Yusuke Iwasawa and Masahiro Suzuki and Yutaka Matsuo and Hiroki Furuta},
  journal= {arXiv preprint arXiv:2511.22989},
  year   = {2026}
}

备注

Accepted to CVPR2026