中文

面向文本到图像生成的不确定性理解与量化

人工智能 2024-12-05 v1 计算机视觉与模式识别 机器学习

摘要

文本到图像(T2I)生成模型的不确定性量化对于理解模型行为和提高输出可靠性至关重要。本文是首次对T2I模型相对于提示词(prompts)的不确定性进行量化与评估。除采用现有旨在衡量图像空间不确定性的方法外,我们还引入基于大型视觉语言模型(LVLMs)的提示基准不确定性估计方法(PUNC),以更好地处理源自提示词和生成图像语义不确定性。PUNC利用LVMM为生成图像生成描述,然后将描述与原始提示词在更语义意义上的文本空间中进行比较。PUNC还通过精确率和召回率实现了对偶发性不确定性和能见性不确定性的解耦,而图像空间方法无法实现此功能。广泛实验表明,PUNC在各种设置下均优于最新不确定性估计技术。文本到图像生成模型的不确定性量化可用于包括偏见检测、版权保护和异常分布检测在内的各种应用。我们还引入了一组文本提示与生成对的综合数据集,以促进面向生成模型不确定性量化的进一步研究。我们的发现表明,PUNC不仅实现了竞争性能,还 enables 在评估和提高文本到图像模型可信度方面实现新应用。

关键词

引用

@article{arxiv.2412.03178,
  title  = {Towards Understanding and Quantifying Uncertainty for Text-to-Image Generation},
  author = {Gianni Franchi and Dat Nguyen Trong and Nacim Belkhir and Guoxuan Xia and Andrea Pilzer},
  journal= {arXiv preprint arXiv:2412.03178},
  year   = {2024}
}

备注

28 pages and 22 figures