SkeleGuide:面向上下文感知人物图像合成的显式骨架推理
计算机视觉与模式识别
2026-03-03 v1 人工智能
摘要
生成逼真且结构合理的人物图像至目前生成模型仍是一大挑战,常导致肢体变形和姿态不自然的伪影。我们认为这种系统性失效源于模型无法对人物骨架结构进行显式推理。为此,我们引入SkeleGuide,一个基于显式骨架推理的新型框架。在推理与渲染阶段的联合训练下,SkeleGuide学习生成一种内部姿态,作为强大的结构先验,引导合成过程达到高结构完整性。为实现细粒度的用户控制,我们引入PoseInverter模块,将内部潜在姿态解码为显式且可编辑的格式。大量实验表明,SkeleGuide在生成高保真、上下文感知的人物图像方面,显著优于专用模型和通用模型。我们的工作为显式建模骨架结构作为实现稳健且合理人物图像合成的关键步骤提供了有力证据。
引用
@article{arxiv.2603.01579,
title = {SkeleGuide: Explicit Skeleton Reasoning for Context-Aware Human-in-Place Image Synthesis},
author = {Chuqiao Wu and Jin Song and Yiyun Fei},
journal= {arXiv preprint arXiv:2603.01579},
year = {2026}
}