中文

CosmicMan:面向人类的文本到图像基础模型

计算机视觉与模式识别 2024-04-02 v1

摘要

我们提出CosmicMan,一个专门用于生成高保真人类图像的文本到图像基础模型。与当前通用基础模型在人类图像上陷入质量低下和文本-图像对齐不佳的困境不同,CosmicMan能够生成具有细致外观、合理结构以及精确文本-图像对齐的照片级真实人类图像,并附带详细的密集描述。CosmicMan成功的核心在于对数据和模型的新反思与视角:(1) 我们发现数据质量和可扩展的数据生产流程对于训练模型的最终结果至关重要。因此,我们提出了一种新的数据生产范式Annotate Anyone,它作为一个永续的数据飞轮,能够随时间产生高质量、准确且成本效益高的标注数据。基于此,我们构建了一个大规模数据集CosmicMan-HQ 1.0,包含600万张高质量真实世界人类图像,平均分辨率为1488×1255,并附有来自1.15亿个不同粒度属性的精确文本标注。(2) 我们认为,一个专门面向人类的文本到图像基础模型必须是实用的——易于集成到下游任务中,同时能有效生成高质量人类图像。因此,我们提出以分解方式建模密集文本描述与图像像素之间的关系,并提出了分解注意力重聚焦(Decomposed-Attention-Refocusing,Daring)训练框架。该框架无缝地分解现有文本到图像扩散模型中的交叉注意力特征,并在不添加额外模块的情况下强制注意力重聚焦。通过Daring,我们表明将连续文本空间显式离散化为与人体结构对齐的几个基本组,是轻松解决对齐问题的关键。

关键词

引用

@article{arxiv.2404.01294,
  title  = {CosmicMan: A Text-to-Image Foundation Model for Humans},
  author = {Shikai Li and Jianglin Fu and Kaiyuan Liu and Wentao Wang and Kwan-Yee Lin and Wayne Wu},
  journal= {arXiv preprint arXiv:2404.01294},
  year   = {2024}
}

备注

Accepted by CVPR 2024. The supplementary material is included. Project Page: https://cosmicman-cvpr2024.github.io