中文

精确度还是召回率?图像标题对训练文本到图像生成模型的分析

计算机视觉与模式识别 2024-11-11 v1 计算与语言

摘要

尽管文本到图像模型取得了进展,但由于训练数据中的对齐不匹配,生成与文本描述精确对齐的图像仍然具有挑战性。本文分析了标题精确度和召回率在文本到图像模型训练中的关键作用。我们对人类标注标题的分析表明,精确度和召回率对文本-图像对齐都很重要,但精确度的影响更为显著。利用这些见解,我们利用大视觉语言模型生成用于训练的合成标题。使用这些合成标题训练的模型表现出与使用人类标注标题训练的模型类似的行为,凸显了合成数据在文本到图像训练中的潜力。

关键词

引用

@article{arxiv.2411.05079,
  title  = {Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model},
  author = {Sheng Cheng and Maitreya Patel and Yezhou Yang},
  journal= {arXiv preprint arXiv:2411.05079},
  year   = {2024}
}

备注

EMNLP 2024 Findings. Code: https://github.com/shengcheng/Captions4T2I