利用标题细节度实现数据高效的文本到图像生成
计算机视觉与模式识别
2025-05-22 v1
摘要
使用详细标题训练文本到图像(T2I)模型可以显著提升其生成质量。现有方法通常依赖简单指标如标题长度来表示 T2I 训练集中标题的细节程度。本文提出了一种基于两个方面的新指标来估计标题细节度:图像覆盖率(ICR),用于评估标题是否覆盖了图像中的所有区域/对象;以及平均对象细节度(AOD),用于量化每个对象描述的细节程度。通过在 COCO 数据集上使用 ShareGPT4V 标题的实验,我们证明在高 ICR 和 AOD 标题上训练的 T2I 模型在 DPG 和其他基准测试上取得了优越性能。值得注意的是,我们的指标实现了更有效的数据选择——仅使用 20% 的完整数据训练即可超越完整数据集训练和基于长度的选择方法,提升了对齐和重建能力。这些发现凸显了细节感知指标在 T2I 任务标题选择中优于基于长度的启发式方法的关键作用。
引用
@article{arxiv.2505.15172,
title = {Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation},
author = {Xinran Wang and Muxi Diao and Yuanzhi Liu and Chunyu Wang and Kongming Liang and Zhanyu Ma and Jun Guo},
journal= {arXiv preprint arXiv:2505.15172},
year = {2025}
}