中文

用于零样本个性化的文本条件化虚拟形象

计算机视觉与模式识别 2023-04-18 v1 人工智能

摘要

近期大规模文本到图像生成模型在合成图像的质量、真实感和多样性上取得了显著改进,并让用户能够通过语言控制所生成的内容。然而,这些生成模型的个性化方面仍然具有挑战性且研究不足。在本工作中,我们提出一种流水线,能够通过捕捉用户身份的虚拟形象以令人愉悦的方式实现图像生成的个性化。我们的流水线是零样本的、与虚拟形象纹理和风格无关的,且完全不需要在虚拟形象上训练——它可扩展到数百万用户,这些用户可以用其虚拟形象生成场景。为了以忠实于给定文本提示的姿势渲染虚拟形象,我们提出了一种新颖的文本到3D姿势扩散模型,该模型在精心整理的大规模野外人体姿势数据集上训练,显著提升了SOTA文本到动作模型的性能。我们首次展示了如何利用大规模图像数据集学习人体3D姿势参数,并克服动作捕捉数据集的局限性。

关键词

引用

@article{arxiv.2304.07410,
  title  = {Text-Conditional Contextualized Avatars For Zero-Shot Personalization},
  author = {Samaneh Azadi and Thomas Hayes and Akbar Shah and Guan Pang and Devi Parikh and Sonal Gupta},
  journal= {arXiv preprint arXiv:2304.07410},
  year   = {2023}
}