中文

Ar2Can:面向多人生成的架构师与艺术家利用画布

计算机视觉与模式识别 2026-04-02 v3

摘要

尽管近期在个性化图像生成方面取得了进展,现有模型始终无法可靠地生成多人场景,往往会合并或丢失面部身份信息。我们提出Ar2Can,一个新颖的两阶段框架,用于多人生成,通过解耦空间规划与身份渲染。架构师预测结构化布局,指定每个人应出现的位置。艺术家随后在受空间锚定面部匹配奖励驱动下合成照片级图像,该奖励将匈牙利空间对齐与身份相似性相结合。这种方法确保面部在正确位置渲染,并忠实保留参考身份信息。我们开发了两种架构变体,无缝集成到基于扩散的艺术家模型中。通过使用组合奖励进行群体相对策略优化(GRPO),以计数准确性、图像质量和身份匹配为优化目标。评估于MultiHuman-Testbench基准后,Ar2Can在计数准确性和身份保留方面实现了显著提升,同时保持高感知质量。值得注意的是,我们的方法仅使用主要合成数据,无需真实的多人图像。项目页面:https://qualcomm-ai-research.github.io/ar2can/。

关键词

引用

@article{arxiv.2511.22690,
  title  = {Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation},
  author = {Shubhankar Borse and Phuc Pham and Farzad Farhadzadeh and Seokeon Choi and Phong Ha Nguyen and Anh Tuan Tran and Sungrack Yun and Munawar Hayat and Fatih Porikli},
  journal= {arXiv preprint arXiv:2511.22690},
  year   = {2026}
}

备注

Accepted to CVPR 2026