中文

PoseLLM:通过 MLP 对齐增强语言引导的人体姿态估计

计算机视觉与模式识别 2025-07-15 v1

摘要

人体姿态估计传统上依赖于编码关键点先验的架构,这限制了其对新姿态或未见关键点的泛化能力。最近的语言引导方法如 LocLLM 将关键点定位重新表述为视觉语言任务,通过文本描述实现零样本泛化。然而,LocLLM 的线性投影器无法捕获对高精度定位至关重要的复杂空间-文本相互作用。为此,我们提出 PoseLLM,首个基于大型语言模型(LLM)的姿态估计框架,用非线性 MLP 视觉-语言连接器取代线性投影器。这种轻量级两层 MLP 带 GELU 激活 enables 分层跨模态特征变换,增强了视觉图块和文本关键点描述的融合。仅在 COCO 数据上训练,PoseLLM 在 COCO 验证集上达到 77.8 个 AP,超越 LocLLM +0.4 个 AP,同时在 Human-Art 和 MPII 上保持强大的零样本泛化。我们的工作表明,一个简单而强大的非线性连接器在不牺牲泛化性的前提下显著提升了定位精度,推动了语言引导姿态估计的前沿进展。代码已公开于 https://github.com/Ody-trek/PoseLLM。

关键词

引用

@article{arxiv.2507.09139,
  title  = {PoseLLM: Enhancing Language-Guided Human Pose Estimation with MLP Alignment},
  author = {Dewen Zhang and Tahir Hussain and Wangpeng An and Hayaru Shouno},
  journal= {arXiv preprint arXiv:2507.09139},
  year   = {2025}
}

备注

Preprint