中文

面向人体理解的可控合成

计算机视觉与模式识别 2024-11-14 v1

摘要

训练鲁棒的三维人体姿态与形状(HPS)估计方法需要具有准确真值的多样化训练图像。虽然BEDLAM展示了传统程序化图形生成此类数据的潜力,但其训练图像明显带有合成痕迹。相比之下,生成式图像模型能生成高度逼真的图像,却缺乏真值。结合这两种方法似乎很直接:利用生成模型并以人体真值作为控制信号。然而我们发现,生成图像越逼真,越偏离真值,使其不适合训练和评估。逼真细节的增强(如服装和面部表情)可能导致微妙但显著的真值偏离,从而误导训练模型。我们实证验证了这种错位导致HPS网络在使用生成图像训练时准确率下降。为此,我们设计了一种可控合成方法,有效平衡了图像真实感与精确真值。我们用它创建了生成式BEDLAM(Gen-B)数据集,在保持真值准确性的同时提升了现有合成BEDLAM数据集的真实感。我们通过各种噪声条件策略进行大量实验,评估视觉真实感与HPS准确性的权衡。我们首次展示了生成式图像模型可被传统图形方法控制,从而生成提高HPS方法准确性的训练数据。

关键词

引用

@article{arxiv.2411.08663,
  title  = {Toward Human Understanding with Controllable Synthesis},
  author = {Hanz Cuevas-Velasquez and Priyanka Patel and Haiwen Feng and Michael Black},
  journal= {arXiv preprint arXiv:2411.08663},
  year   = {2024}
}