中文

神经交互式关键点检测

计算机视觉与模式识别 2023-08-22 v1

摘要

本工作提出了一种名为 Click-Pose 的端到端神经交互式关键点检测框架,与纯人工标注相比,该框架可将 2D 关键点标注的标注成本显著降低 10 倍以上。Click-Pose 探索了用户反馈如何与神经关键点检测器协作,以交互方式纠正预测关键点,从而实现更快、更有效的标注过程。具体而言,我们设计了姿态误差建模策略,将真实姿态与四种典型姿态误差一同输入解码器,并训练模型重建正确姿态,从而增强模型的自我纠正能力。随后,我们接入一个交互式人类反馈回路,允许接收用户点击以纠正一个或多个预测关键点,并迭代利用解码器以最少点击次数(NoC)更新所有其他关键点,实现高效标注。我们在同域、跨域场景以及关键点自适应新任务上验证了 Click-Pose。在标注方面,Click-Pose 在 COCO 和 Human-Art 上仅需 1.97 和 6.45 的 NoC@95(精度 95%),分别比带人工纠正的 SOTA 模型(ViTPose)减少 31.4% 和 36.3% 的工作量。此外,在无用户点击时,Click-Pose 在 COCO 上超越先前端到端模型 1.4 AP,在 Human-Art 上超越 3.0 AP。代码见 https://github.com/IDEA-Research/Click-Pose。

关键词

引用

@article{arxiv.2308.10174,
  title  = {Neural Interactive Keypoint Detection},
  author = {Jie Yang and Ailing Zeng and Feng Li and Shilong Liu and Ruimao Zhang and Lei Zhang},
  journal= {arXiv preprint arXiv:2308.10174},
  year   = {2023}
}

备注

Accepted to ICCV 2023