用于人体解析的深度学习技术:综述与展望
计算机视觉与模式识别
2024-03-15 v2
摘要
人体解析旨在将图像或视频中的人体划分为多个像素级语义部件。在过去十年中,它引起了计算机视觉界的显著关注,并被广泛应用于从安全监控、社交媒体到视觉特效等众多实际场景中。尽管基于深度学习的人体解析方案已取得显著成就,但许多重要概念、现有挑战与潜在研究方向仍令人困惑。在本综述中,我们全面回顾了三个核心子任务:单人解析、多人解析和视频人体解析,介绍了它们各自的任务设定、背景概念、相关问题与应用、代表性文献及数据集。我们还给出了所综述方法在基准数据集上的定量性能比较。此外,为促进社区的可持续发展,我们提出了一种基于 transformer 的人体解析框架,通过通用、简洁且可扩展的解决方案为后续研究提供高性能基线。最后,我们指出了该领域中一组未被充分研究的开放问题,并建议了未来研究的新方向。我们还提供了一个定期更新的项目页面,以持续跟踪这一快速发展领域的最新进展:https://github.com/soeaver/awesome-human-parsing。
引用
@article{arxiv.2301.00394,
title = {Deep Learning Technique for Human Parsing: A Survey and Outlook},
author = {Lu Yang and Wenhe Jia and Shan Li and Qing Song},
journal= {arXiv preprint arXiv:2301.00394},
year = {2024}
}
备注
Accepted for publication in International Journal of Computer Vision (IJCV)