中文

ASTRA:通过检索增强姿态引导和解缝位置嵌入提升多主体生成

计算机视觉与模式识别 2026-04-16 v1

摘要

主体驱动的图像生成在创建个性化内容方面取得了很大成功,但其能力主要局限于单一主体的常见姿态。当前方法在处理具有复杂、不同动作的多个主体时面临根本性冲突:在保持精确姿态结构的同时保护个体身份。这种挑战常导致身份融合和姿态畸变,因为外观和结构信号在模型架构中被缠绕。为解决此冲突,我们引入 ASTRA(通过目标检索增强自适应合成),一个在统一扩散变换器中架构性解缝主体外观与姿态结构的新框架。ASTRA 首先采用检索增强姿态(RAG-Pose)管道从精选数据库中提供干净、明确的结构先验。然后,其核心生成模型学习处理这些双重视觉条件,利用我们增强的通用旋转位置嵌入(EURoPE),这是一种非对称编码机制,将身份令牌与空间位置解耦,同时将姿态令牌绑定到画布上。同时,解缝语义调制(DSM)适配器将身份保持任务卸载到文本条件流中。广泛的实验表明,我们的集成方法实现了卓越的解缝。在设计的基于 COCO 的复杂姿态基准测试上,ASTRA 在姿态遵循度上实现了新出现的 state-of-the-art,同时在 DreamBench 中保持了高的身份保真度和文本对齐。

关键词

引用

@article{arxiv.2604.13938,
  title  = {ASTRA: Enhancing Multi-Subject Generation with Retrieval-Augmented Pose Guidance and Disentangled Position Embedding},
  author = {Tianze Xia and Zijian Ning and Zonglin Zhao and Mingjia Wang},
  journal= {arXiv preprint arXiv:2604.13938},
  year   = {2026}
}