语言模型生成的姿态先验
计算机视觉与模式识别
2025-05-16 v2 计算与语言
摘要
语言常用于描述物理交互,但大多数 3D 人体姿态估计方法却忽视了这一丰富的信息源。我们通过利用大型多模态模型(LMM)作为先验来重建接触姿态,为传统依赖人工标注或运动捕捉数据的方法提供了可扩展的替代方案。我们的方法从 LMM 中提取与接触相关的描述符,并将其转化为可处理的损失,以约束 3D 人体姿态优化。尽管方法简单,却能为两种人之间的相互作用和自我接触场景生成引人注目的重建,准确捕捉物理和社交交互的语义。我们的结果表明,LMM 可作为接触预测和姿态估计的强大工具,为昂贵的人工标注或运动捕捉数据提供了替代方案。我们的代码已公开发布于 https://prosepose.github.io。
引用
@article{arxiv.2405.03689,
title = {Pose Priors from Language Models},
author = {Sanjay Subramanian and Evonne Ng and Lea Müller and Dan Klein and Shiry Ginosar and Trevor Darrell},
journal= {arXiv preprint arXiv:2405.03689},
year = {2025}
}
备注
CVPR 2025