AIpparel:用于数字服饰的多模态基础模型
计算机视觉与模式识别
2025-04-08 v5
摘要
服装是人类生活中必不可少的物品,提供保护,映射文化身份,并展现个人风格。然而,服装的创建仍是一个耗时的过程,主要由于设计过程中涉及的手动工作。为简化这一过程,我们介绍AIpparel——一个用于生成和编辑制作图案的多模态基础模型。该模型在包含超过120,000件独特服装的自定义精选大规模数据集上,对领先的大型多模态模型(LMM)进行微调,每个样本都包含文本、图像和制作图案的多模态标注。此外,我们提出了一种新颖的分词方案,以简洁的方式对这些复杂的制作图案进行编码,以便LLM能够高效学习预测。AIpparel在包括文本到服装和图像到服装预测等单模态任务方面实现了最先进的性能,并 enables 新的多模态服装生成应用,如交互式服装编辑。项目网站位于 https://georgenakayama.github.io/AIpparel/。
引用
@article{arxiv.2412.03937,
title = {AIpparel: A Multimodal Foundation Model for Digital Garments},
author = {Kiyohiro Nakayama and Jan Ackermann and Timur Levent Kesdogan and Yang Zheng and Maria Korosteleva and Olga Sorkine-Hornung and Leonidas J. Guibas and Guandao Yang and Gordon Wetzstein},
journal= {arXiv preprint arXiv:2412.03937},
year = {2025}
}
备注
The project website is at https://georgenakayama.github.io/AIpparel/