中文

您的文本到图像模型对 caption 噪声鲁棒吗?

计算机视觉与模式识别 2024-12-30 v1 人工智能

摘要

在文本到图像 (T2I) 生成中,普遍的训练技术是利用视觉语言模型 (VLM) 对图像进行重新标注。尽管 VLM 已知会出现幻觉,生成的内容偏离视觉现实,但这种标注幻觉对 T2I 生成性能的影响仍未得到充分探讨。通过我们的实证研究,我们首先建立了一个包含 VLM 生成标注的综合数据集,然后系统性地分析了标注幻觉如何影响生成结果。我们的发现表明:(1) 标注质量的差异在微调期间持续影响模型输出。(2) VLM 置信度分数可靠地指示数据分布中与噪声相关的模式。(3) 即使是细微的标注忠诚度变化也对学习到的表征质量产生显著影响。这些发现共同凸显了标注质量对模型性能的深远影响,并突出了在 T2I 中需要更精致的鲁棒训练算法的必要性。针对这些观察,我们提出了一种利用 VLM 置信度分数来缓解标注噪声的 method,从而增强 T2I 模型对标注中幻觉的鲁棒性。

关键词

引用

@article{arxiv.2412.19531,
  title  = {Is Your Text-to-Image Model Robust to Caption Noise?},
  author = {Weichen Yu and Ziyan Yang and Shanchuan Lin and Qi Zhao and Jianyi Wang and Liangke Gui and Matt Fredrikson and Lu Jiang},
  journal= {arXiv preprint arXiv:2412.19531},
  year   = {2024}
}