一图胜千言:原则性重标注提升图像生成
计算机视觉与模式识别
2023-10-26 v1 人工智能
机器学习
摘要
文本到图像扩散模型在过去几年中取得了显著的能力飞跃,能够从文本提示中高质量且多样化地合成图像。然而,即使是最先进的模型也常常难以精确遵循提示中的所有指令。这些模型绝大多数在由(图像,标注)对组成的数据集上训练,其中图像常来自网络,标注为其 HTML 替代文本。一个显著的例子是被 Stable Diffusion 及其他模型使用的 LAION 数据集。本工作中我们观察到这些标注往往质量较低,并认为这严重影响了模型理解文本提示中细微语义的能力。我们展示通过使用专门的自动标注模型重新标注语料库,并在重标注数据集上训练文本到图像模型,模型在各方面均获益显著。第一,在整体图像质量上:例如 FID 14.84 对比基线 17.87,且根据人工评估忠实图像生成提升 64.3%。第二,在语义对齐上:例如语义对象准确率 84.34 对比 78.90,计数对齐误差 1.32 对比 1.44,位置对齐 62.42 对比 57.60。我们分析了重新标注语料库的多种方法,并提供证据表明这一我们称之为 RECAP 的技术既减少了训练-推理不一致,又为模型提供了每个样本更多信息,提升了样本效率并让模型更好地理解标注与图像间的关系。
引用
@article{arxiv.2310.16656,
title = {A Picture is Worth a Thousand Words: Principled Recaptioning Improves Image Generation},
author = {Eyal Segalis and Dani Valevski and Danny Lumen and Yossi Matias and Yaniv Leviathan},
journal= {arXiv preprint arXiv:2310.16656},
year = {2023}
}