中文

LogicRank:面向生成式文本到图像系统的逻辑诱导重排序方法

人工智能 2022-08-30 v1 计算与语言 计算机视觉与模式识别 计算机科学中的逻辑 符号计算

摘要

文本到图像模型最近取得了显著成功,生成的样本看似精确且具有照片级真实质量。然而,由于最先进的语言模型在一致地评估精确陈述方面仍存在困难,基于语言模型的图像生成过程也是如此。在这项工作中,我们展示了最先进的文本到图像模型(如 DALL-E)在根据与 draw bench 基准相关的陈述生成准确样本时存在的问题。此外,我们表明 CLIP 无法一致地对那些生成的样本进行重排序。为此,我们提出了 LogicRank,一种神经符号推理框架,可在这种对精度有要求的场景下产生更准确的排序系统。LogicRank 可平滑地集成到文本到图像模型的生成过程中,并且可用于进一步微调以得到逻辑更精确的模型。

关键词

引用

@article{arxiv.2208.13518,
  title  = {LogicRank: Logic Induced Reranking for Generative Text-to-Image Systems},
  author = {Björn Deiseroth and Patrick Schramowski and Hikaru Shindo and Devendra Singh Dhami and Kristian Kersting},
  journal= {arXiv preprint arXiv:2208.13518},
  year   = {2022}
}