LogicRank:面向生成式文本到图像系统的逻辑诱导重排序方法
人工智能
2022-08-30 v1 计算与语言
计算机视觉与模式识别
计算机科学中的逻辑
符号计算
摘要
文本到图像模型最近取得了显著成功,生成的样本看似精确且具有照片级真实质量。然而,由于最先进的语言模型在一致地评估精确陈述方面仍存在困难,基于语言模型的图像生成过程也是如此。在这项工作中,我们展示了最先进的文本到图像模型(如 DALL-E)在根据与 draw bench 基准相关的陈述生成准确样本时存在的问题。此外,我们表明 CLIP 无法一致地对那些生成的样本进行重排序。为此,我们提出了 LogicRank,一种神经符号推理框架,可在这种对精度有要求的场景下产生更准确的排序系统。LogicRank 可平滑地集成到文本到图像模型的生成过程中,并且可用于进一步微调以得到逻辑更精确的模型。
引用
@article{arxiv.2208.13518,
title = {LogicRank: Logic Induced Reranking for Generative Text-to-Image Systems},
author = {Björn Deiseroth and Patrick Schramowski and Hikaru Shindo and Devendra Singh Dhami and Kristian Kersting},
journal= {arXiv preprint arXiv:2208.13518},
year = {2022}
}