中文

X-Pose:检测任意关键点

计算机视觉与模式识别 2024-07-18 v2

摘要

本工作旨在解决一个进阶关键点检测问题:如何在复杂真实场景中准确检测任意关键点,其涉及海量、杂乱且开放式的物体及其关联关键点定义。当前高性能关键点检测器常因两阶段方案、欠探索的提示设计及有限训练数据而难以应对此问题。为弥补差距,我们提出 X-Pose,一种新颖端到端框架,利用多模态(即视觉、文本或其组合)提示检测给定图像中任意关节式(如人与动物)、刚性与柔性物体的多物体关键点。此外,我们引入称为 UniKPT 的大规模数据集,统一了 13 个关键点检测数据集,涵盖 1,237 类共 400K 实例的 338 个关键点。基于跨模态对比学习的多模态提示相互增强,使用 UniKPT 训练的 X-Pose 有效对齐文本到关键点与图像到关键点。实验结果表明,在各自公平设定下,X-Pose 相较最优不可提示、视觉提示基与文本提示基方法分别取得 27.7 AP、6.44 PCK 与 7.0 AP 的显著提升。更重要的是,野外测试展示了 X-Pose 跨图像风格、物体类别与姿态的强大细粒度关键点定位与泛化能力,为多物体关键点检测在实际应用中的落地开辟新路径。代码与数据集见 https://github.com/IDEA-Research/X-Pose。

关键词

引用

@article{arxiv.2310.08530,
  title  = {X-Pose: Detecting Any Keypoints},
  author = {Jie Yang and Ailing Zeng and Ruimao Zhang and Lei Zhang},
  journal= {arXiv preprint arXiv:2310.08530},
  year   = {2024}
}

备注

ECCV24