中文

以人为中心的视觉中的数据增强

计算机视觉与模式识别 2024-03-14 v1

摘要

本综述对以人为中心的视觉任务中的数据增强技术进行了全面分析,这在该领域尚属首次。它深入探讨了包括行人重识别 (person ReID)、人体解析、人体姿态估计和行人检测在内的广泛研究领域,应对了这些领域中由过拟合和有限训练数据带来的重大挑战。我们的工作将数据增强方法分为两大类:数据生成和数据扰动。数据生成涵盖基于图形引擎的生成、基于生成模型的生成和数据重组等技术,而数据扰动则分为图像级扰动和人体级扰动。每种方法都针对以人为中心任务的独特需求进行了定制,其中一些方法可跨多个领域应用。我们的贡献包括广泛的文献综述,对这些增强技术在以人为中心的视觉中的影响提供了深刻见解,并突出了每种方法的细微差别。我们还讨论了开放问题和未来方向,例如集成先进的生成模型(如 Latent Diffusion Models),以创建更真实、更多样化的训练数据。本综述不仅概括了以人为中心的视觉中数据增强的现状,还为未来的研究指明了方向,旨在开发更鲁棒、更准确、更高效的以人为中心的视觉系统。

关键词

引用

@article{arxiv.2403.08650,
  title  = {Data Augmentation in Human-Centric Vision},
  author = {Wentao Jiang and Yige Zhang and Shaozhong Zheng and Si Liu and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2403.08650},
  year   = {2024}
}