SEED-Data-Edit 技术报告:用于指令式图像编辑的混合数据集
计算机视觉与模式识别
2024-05-08 v1
摘要
本技术报告介绍了SEED-Data-Edit:一个独特的混合数据集,用于指令导向图像编辑,旨在促进使用开放式语言进行图像 manipulation。SEED-Data-Edit由三种不同类型的数据组成:(1) 由自动化管道生产的高质量编辑数据,确保大量多样化的图像编辑对;(2) 来自互联网收集的真实世界情景数据,捕捉用户意图的细微差别,以促进在真实世界中实际应用图像编辑;(3) 由人工标注的高精度多轮编辑数据,涉及多个编辑轮次,以模拟迭代编辑过程。这些多样化数据源的组合使SEED-Data-Edit成为训练语言导向图像编辑模型的全面且多功能的数据集。我们对预训练的多模态大语言模型(MLLM)进行微调,将理解和生成统一到SEED-Data-Edit上。经过指令调优的模型显示出有前景的结果,表明SEED-Data-Edit在推进指令式图像编辑领域方面具有潜力和有效性。数据集已发布在 https://huggingface.co/datasets/AILab-CVC/SEED-Data-Edit。
引用
@article{arxiv.2405.04007,
title = {SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing},
author = {Yuying Ge and Sijie Zhao and Chen Li and Yixiao Ge and Ying Shan},
journal= {arXiv preprint arXiv:2405.04007},
year = {2024}
}
备注
Technical Report; Dataset released in https://huggingface.co/datasets/AILab-CVC/SEED-Data-Edit