中文

一种用于域自适应姿态估计的统一框架

计算机视觉与模式识别 2022-08-09 v3 机器学习

摘要

尽管姿态估计是一项重要的计算机视觉任务,但它需要昂贵的标注且受域偏移的困扰。本文研究无监督地将合成源域上学到的知识迁移到目标域的域自适应二维姿态估计问题。尽管近期已有若干域自适应姿态估计模型被提出,它们并不通用,而仅关注人体姿态或动物姿态估计,因此其有效性在一定程度上受限于特定场景。本工作中,我们提出一个在各种域自适应姿态估计问题上均能良好泛化的统一框架。我们提出利用输入级和输出级线索(分别为像素和姿态标签)对齐表征,从而促进知识从源域向无标签目标域的迁移。实验表明,我们的方法在各种域偏移下均达到了最先进的性能。在人体姿态估计上我们的方法比现有基线高出至多 4.5 个百分点(pp),手部姿态估计高出至多 7.4 pp,动物姿态估计中狗高出至多 4.8 pp、羊高出至多 3.3 pp。这些结果表明我们的方法能够缓解多样任务甚至未见过的域和对象上的域偏移(例如,在马匹上训练而在狗上测试)。我们的代码将公开于:https://github.com/VisionLearningGroup/UDA_PoseEstimation。

关键词

引用

@article{arxiv.2204.00172,
  title  = {A Unified Framework for Domain Adaptive Pose Estimation},
  author = {Donghyun Kim and Kaihong Wang and Kate Saenko and Margrit Betke and Stan Sclaroff},
  journal= {arXiv preprint arXiv:2204.00172},
  year   = {2022}
}