中文

基于姿态引导的人群姿态分割:SAM-pose2seg

计算机视觉与模式识别 2026-01-19 v2

摘要

Segment Anything (SAM) 为人类分割提供了前所未有的基础,但在遮挡情况下可能难以处理,其中关键点可能部分或完全不可见。我们将 SAM 2.1 适用于姿态引导分割,仅通过少量的编码器修改保留其强大的泛化能力。使用称为 PoseMaskRefine 的微调策略,我们将可见性较高的姿态关键点纳入原由 SAM 所使用的迭代校正过程中,提高了鲁棒性和准确性。推理期间,我们简化了提示方式,只选择可见性最高的三个关键点。该策略降低了对常见错误的敏感性,如缺失身体部位或错误分类服装,允许仅凭一个关键点即可准确预测掩码。我们的结果表明,姿态引导的 SAM 微调可实现有效的、遮挡感知的人类分割,同时保留原始模型的泛化能力。代码和预训练模型将在 https://mirapurkrabek.github.io/BBox-Mask-Pose/ 提供。

关键词

引用

@article{arxiv.2601.08982,
  title  = {SAM-pose2seg: Pose-Guided Human Instance Segmentation in Crowds},
  author = {Constantin Kolomiiets and Miroslav Purkrabek and Jiri Matas},
  journal= {arXiv preprint arXiv:2601.08982},
  year   = {2026}
}

备注

GitHub: https://github.com/MiraPurkrabek/BBoxMaskPose/