PointT2I:基于 LLM 的关键点驱动文本到图像生成
计算机视觉与模式识别
2026-02-03 v2
摘要
文本到图像(T2I)生成模型取得了显著进展,能够生成与输入提示对齐的高质量图像。然而,尽管 T2I 生成能够生成细粒度图像,但当输入提示包含复杂概念(尤其是人体姿态)时,它仍面临准确生成图像的挑战。在本文中,我们提出了 PointT2I,这是一个利用大型语言模型(LLM)有效生成与提示中描述的人体姿态准确对应的图像的框架。PointT2I 由三个组件组成:关键点生成、图像生成和反馈系统。关键点生成使用 LLM 仅基于输入提示直接生成对应于人体姿态的关键点,无需外部参考。随后,图像生成根据文本提示和生成的关键点生成图像,以准确反映目标姿态。为了优化前序阶段的输出,我们引入了基于 LLM 的反馈系统,用于评估生成内容与给定提示之间的语义一致性。我们的框架是首个利用 LLM 进行关键点引导图像生成且无需任何微调的方法,仅基于文本提示即可生成准确的姿态对齐图像。
引用
@article{arxiv.2506.01370,
title = {PointT2I: LLM-based text-to-image generation via keypoints},
author = {Taekyung Lee and Donggyu Lee and Myungjoo Kang},
journal= {arXiv preprint arXiv:2506.01370},
year = {2026}
}