中文

VISUALCENT:基于动态质心表示的视觉人类分析

计算机视觉与模式识别 2025-04-29 v1 人工智能

摘要

我们提出了 VISUALCENT,一个统一的人体姿态与实例分割框架,以解决多人视觉人类分析中的可扩展性与通用性限制。VISUALCENT 利用基于质心的自下而上关键点检测范式,并采用包含 Disk Representation 与 KeyCentroid 的关键点热图,以识别最优关键点坐标。对于统一的分割任务,定义了一个动态质心,称为 MaskCentroid,以在人体姿态快速变换或严重遮挡环境下的快速聚类像素到特定人类实例。在 COCO 与 OCHuman 数据集上的实验结果表明,VISUALCENT 在 mAP 分数和每秒帧率方面具有准确性和实时性能优势,超越了现有方法。该实现已在项目页面上提供。

关键词

引用

@article{arxiv.2504.19032,
  title  = {VISUALCENT: Visual Human Analysis using Dynamic Centroid Representation},
  author = {Niaz Ahmad and Youngmoon Lee and Guanghui Wang},
  journal= {arXiv preprint arXiv:2504.19032},
  year   = {2025}
}