中文

ChatGarment:基于大语言模型的服装估计、生成与编辑

计算机视觉与模式识别 2025-04-04 v3

摘要

我们提出ChatGarment,一种利用大型视觉语言模型(VLM)自动化估计、生成和编辑3D服装的方法。不同于现有方法在现实场景中难以实现或缺乏交互式编辑能力,ChatGarment可从图像或文本描述中估计、生成服装,并通过用户指令进行编辑,全部在交互式对话中完成。这些服装 sewing pattern随后可用于3D人体上拖布并进行动画。通过微调VLM直接生成包含服装类型与风格文字描述以及连续数值属性的JSON文件,实现上述目标。该JSON文件随后用于通过编程参数模型创建服装 sewing pattern。为支持这一目标,我们通过扩展覆盖更多服装类型并简化结构以提高VLM微调效率,改进了现有的编程模型GarmentCode。此外,我们通过自动化数据管道构建了大规模的图像到 sewing pattern 与文本到 sewing pattern 配对数据集。广泛的评估表明,ChatGarment能够准确重建、生成和编辑来自多模态输入的服装,凸显其在时尚和游戏应用中的潜在价值。代码与数据已公开:https://chatgarment.github.io/。

关键词

引用

@article{arxiv.2412.17811,
  title  = {ChatGarment: Garment Estimation, Generation and Editing via Large Language Models},
  author = {Siyuan Bian and Chenghao Xu and Yuliang Xiu and Artur Grigorev and Zhen Liu and Cewu Lu and Michael J. Black and Yao Feng},
  journal= {arXiv preprint arXiv:2412.17811},
  year   = {2025}
}

备注

CVPR 2025