MONET:一个大规模、开源、非冗余且丰富的文本到图像数据集
计算机视觉与模式识别
2026-05-21 v1 人工智能
摘要
训练大规模文本到图像模型需要高质量、精心挑选的数据集,需具备多样化内容和详尽的标题。然而,大规模收集、筛选、去重和重新标注此类语料库的成本与复杂性,阻碍了该领域的开放且可复现的研究。我们介绍 MONET,一个约为 1.049 亿张图像-文本对的开源 Apache 2.0 数据集,源自 290 亿个原始数据对,经过一系列安全筛选、基于领域的筛选、精确及近似去重,以及使用覆盖从短描述到长描述的多种视觉语言模型进行重新标注,并进一步增强了合成生成样本。每张图像附带预计算的嵌入和标注,以加速下游使用。为验证 MONET 的有效性,我们仅使用它训练了一个拥有 40 亿参数的潜在扩散模型,取得了具竞争力的 GenEval 和 DPG 分数,表明该数据集降低了大规模、可复现的文本到图像研究的门槛。
引用
@article{arxiv.2605.21272,
title = {MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset},
author = {Benjamin Aubin and Gonzalo Iñaki Quintana and Onur Tasar and Sanjeev Sreetharan and Urszula Czerwinska and Damien Henry and Clément Chadebec},
journal= {arXiv preprint arXiv:2605.21272},
year = {2026}
}