中文

Pose-RFT:通过混合动作强化微调提升 MLLMs 的 3D 姿态生成能力

计算机视觉与模式识别 2025-08-12 v1

摘要

从图像或文本等多模态输入生成 3D 人体姿态需要模型捕捉丰富的空间与语义对应关系。虽然针对姿态的多模态大语言模型(MLLM)在此任务中显示出前景,但它们通常使用 SMPL 参数回归或标记级预测等监督目标进行训练,这类方法难以建模内在的歧义性,无法实现针对精确 3D 姿态生成所需的任务特定对齐。为此,我们提出了 Pose-RFT,这是一个针对 MLLMs 中 3D 人体姿态生成的强化微调框架。我们将该任务形式化为混合动作强化学习问题,以联合优化离散语言预测和连续姿态生成。为此,我们引入了 HyGRPO,这一混合强化学习算法,对抽样响应执行分组奖励归一化,以指导离散与连续动作的联合优化。Pose-RFT 进一步融入任务特定奖励函数,以引导优化在图像到姿态生成中的空间对齐,在文本到姿态生成中的语义一致性。大量实验表明,Pose-RFT 在多个姿态生成基准上显著优于现有姿态特定 MLLMs,验证了混合动作强化微调在 3D 姿态生成中的有效性。

关键词

引用

@article{arxiv.2508.07804,
  title  = {Pose-RFT: Enhancing MLLMs for 3D Pose Generation via Hybrid Action Reinforcement Fine-Tuning},
  author = {Bao Li and Xiaomei Zhang and Miao Xu and Zhaoxin Fan and Xiangyu Zhu and Zhen Lei},
  journal= {arXiv preprint arXiv:2508.07804},
  year   = {2025}
}