中文

Fine-T2I:用于高质量 T2I 微调的开放、大规模且多样化数据集

计算机视觉与模式识别 2026-02-11 v1

摘要

高质量且开放的数据集仍是文本到图像(T2I)微调的主要瓶颈。尽管模型架构和训练管道取得了快速进展,但大多数公开可用的微调数据集存在分辨率低、文本-图像对齐不良或多样性有限的问题,导致开放研究模型与企业级模型之间存在明显的性能差距。本文提出 Fine-T2I,一个大规模、高质量且完全开放的 T2I 微调数据集。Fine-T2I 覆盖 10 种任务组合、32 个提示类别、11 种视觉风格和 5 种提示模板, 将由强大现代模型生成的合成图像与来自专业摄影师精心筛选的真实图像相结合。所有样本都严格筛选其文本-图像对齐、视觉保真度和提示质量,超过 95% 的初始候选者被移除。最终数据集包含超过 600 万 条文本-图像对,约 2 TB,规模接近预训练数据集,同时保持微调级别的质量。在多样化的预训练扩散模型和自回归模型上进行微调,Fine-T2I 能一致地提高生成质量和指令遵循度,经人类评估、视觉比较和自动指标验证。我们以开放许可证发布 Fine-T2I,以帮助在开放社区中缩小 T2I 微调的数据差距。

关键词

引用

@article{arxiv.2602.09439,
  title  = {Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning},
  author = {Xu Ma and Yitian Zhang and Qihua Dong and Yun Fu},
  journal= {arXiv preprint arXiv:2602.09439},
  year   = {2026}
}

备注

Dataset: https://huggingface.co/datasets/ma-xu/fine-t2i