Pico-Banana-400K:用于文本引导图像编辑的大规模数据集
计算机视觉与模式识别
2025-10-23 v1 计算与语言
机器学习
摘要
多模态模型的最新进展展示了卓越的文本引导图像编辑能力,GPT-4o和Nano-Banana等系统树立了新的标杆。然而,研究界的进展仍然受到缺乏基于真实图像构建的大规模、高质量、公开可访问数据集的限制。我们推出了Pico-Banana-400K,这是一个包含40万张图像的综合性指令式图像编辑数据集。我们的数据集是通过利用Nano-Banana从OpenImages集合中的真实照片生成多样化的编辑对来构建的。Pico-Banana-400K与以往合成数据集的不同之处在于我们系统化的质量和多样性处理方法。我们采用细粒度的图像编辑分类法,以确保编辑类型的全面覆盖,同时通过基于MLLM的质量评分和精心筛选来保证精确的内容保留和指令忠实度。除了单轮编辑外,Pico-Banana-400K还支持对复杂编辑场景的研究。该数据集包含三个专门的子集:(1) 一个包含7.2万个示例的多轮编辑集合,用于研究跨连续修改的顺序编辑、推理和规划;(2) 一个包含5.6万个示例的偏好子集,用于对齐研究和奖励模型训练;(3) 配对的短长编辑指令,用于开发指令重写和摘要能力。通过提供这种大规模、高质量且任务丰富的资源,Pico-Banana-400K为训练和基准测试下一代文本引导图像编辑模型奠定了坚实的基础。
引用
@article{arxiv.2510.19808,
title = {Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing},
author = {Yusu Qian and Eli Bocek-Rivele and Liangchen Song and Jialing Tong and Yinfei Yang and Jiasen Lu and Wenze Hu and Zhe Gan},
journal= {arXiv preprint arXiv:2510.19808},
year = {2025}
}