论文复述:基于推理的姿态估计基准中的可靠性问题
计算机视觉与模式识别
2025-07-18 v1 人工智能
摘要
基于推理的姿态估计(RPE)基准已成为评估具有姿态感知能力的多模态大语言模型(MLLM)的广泛采用的评估标准。尽管其重要性已久,但我们识别出致命的可重复性和基准质量问题,阻碍了公平且一致的定量评估。最显著的是,该基准使用与原始3DPW数据集不同的图像索引,迫使研究人员进行繁琐且易出错的手动匹配过程,以获得用于定量指标(如MPJPE、PA-MPJPE)的准确 ground-truth(GT)注释。此外,我们的分析揭示了若干内在的基准质量局限,包括显著的图像冗余、情景不平衡、姿态过于简单以及模糊的文本描述,整体上削弱了跨 diverse 场景的可靠评估。为缓解手动工作量并提高可重复性,我们通过严谨的视觉匹配细化了GT注释,并公开发布这些细化后的注释作为开源资源,从而促进了一致的定量评估,推动了人类姿态感知多模态推理领域的未来发展。
引用
@article{arxiv.2507.13314,
title = {Revisiting Reliability in the Reasoning-based Pose Estimation Benchmark},
author = {Junsu Kim and Naeun Kim and Jaeho Lee and Incheol Park and Dongyoon Han and Seungryul Baek},
journal= {arXiv preprint arXiv:2507.13314},
year = {2025}
}
备注
To be presented as a poster at MMFM 2025