中文

基于 CLIP 的无图像域泛化方法用于三维手姿估计

计算机视觉与模式识别 2022-11-01 v1

摘要

得益于大规模数据库与深度学习,基于 RGB 的三维手姿估计数十年来已取得长足成功。然而,对于特征与训练数据差异显著的手姿图像,手姿估计网络表现不佳。这由输入图像中的光照、相机角度、多样背景等多种因素导致。许多现有方法试图通过提供额外的大规模无约束/目标域图像来扩充数据空间以解决该问题;但收集此类大规模图像需耗费大量人力。本文提出一种简单的无图像域泛化方法,用于仅使用源域数据的手姿估计框架。我们尝试利用 CLIP (Contrastive Language-Image Pre-training,对比语言-图像预训练) 模型,通过加入来自文本描述的特征来操控手姿估计网络的图像特征。随后,被操控的图像特征通过对比学习框架用于训练手姿估计网络。在 STB 与 RHD 数据集上的实验中,我们的算法相比最先进的(state-of-the-art, SOTA)域泛化方法表现出更优性能。

关键词

引用

@article{arxiv.2210.16788,
  title  = {Image-free Domain Generalization via CLIP for 3D Hand Pose Estimation},
  author = {Seongyeong Lee and Hansoo Park and Dong Uk Kim and Jihyeon Kim and Muhammadjon Boboev and Seungryul Baek},
  journal= {arXiv preprint arXiv:2210.16788},
  year   = {2022}
}