Pose-Star:面向开放世界时尚图像的解剖学感知编辑
计算机视觉与模式识别
2025-07-08 v1 人工智能
摘要
为推进现实世界时尚图像编辑,我们分析现有两阶段管线(掩码生成后进行基于扩散的编辑),其过度关注生成器优化而忽视掩码的可控性。这导致两个关键局限性:I)用户定义的灵活性差(粗粒度人体掩码限制编辑仅限于预定义区域,如上身;细粒度服装掩码保留姿态但禁止风格/长度定制)。II)姿态鲁棒性差(掩码生成器因关节姿态失效,漏掉如腰部等罕见区域,而人体解析器受限于预定义类别)。为解决此问题,我们提出Pose-Star框架,通过动态重组身体结构(如颈部、胸部等)生成解剖学感知掩码(如胸部长度),以实现用户定义编辑。在Pose-Star中,我们通过骨骼关键点校准扩散派生注意力(Star tokens),增强复杂姿态下罕见结构的定位,通过基于相位的注意力动力学分析(收敛、稳定、发散)结合阈值掩码和滑动窗口融合抑制噪声,并通过跨自注意力合并和Canny对齐 refine 边缘。本工作桥接受控基准与开放世界需求,开创性地实现了解剖学感知、姿态鲁棒的编辑,为工业级时尚图像编辑奠定基础。
引用
@article{arxiv.2507.03402,
title = {Pose-Star: Anatomy-Aware Editing for Open-World Fashion Images},
author = {Yuran Dong and Mang Ye},
journal= {arXiv preprint arXiv:2507.03402},
year = {2025}
}
备注
18 pages, 17 figures, ICCV25