中文

VLPose:通过语言-视觉调优弥合姿态估计中的领域差距

计算机视觉与模式识别 2024-02-23 v1

摘要

得益于深度学习技术的进步,人体姿态估计(HPE)在自然场景中取得了显著进展。然而,由于领域差距,这些模型在绘画、雕塑等人工场景中表现不佳,限制了虚拟现实和增强现实的发展。随着模型规模的增大,在自然数据和人工数据上重新训练整个模型计算成本高昂且效率低下。本研究旨在通过高效的调优策略弥合自然场景与人工场景之间的领域差距。利用语言模型的潜力,我们提出了一种名为VLPose的新框架,增强了传统姿态估计模型在不同场景中的适应性。VLPose利用语言与视觉的协同作用,将姿态估计模型的泛化能力和鲁棒性扩展到传统领域之外。与最先进的调优策略相比,我们的方法在HumanArt和MSCOCO上分别提升了2.26%和3.74%。

关键词

引用

@article{arxiv.2402.14456,
  title  = {VLPose: Bridging the Domain Gap in Pose Estimation with Language-Vision Tuning},
  author = {Jingyao Li and Pengguang Chen and Xuan Ju and Hong Xu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2402.14456},
  year   = {2024}
}