FormCoach:更聪明地举铁,而非更费力
计算机视觉与模式识别
2025-10-14 v3 人机交互
摘要
良好的动作姿态是力量与劳损之间的区别,然而对于快速增长的居家健身爱好者群体而言,专家反馈往往遥不可及。FormCoach 将一台简单的摄像头转变为一个始终在线、交互式的 AI 训练伙伴,能够利用视觉-语言模型(VLM)实时发现细微的姿态错误并提供量身定制的纠正。我们通过一个网页界面展示了这一能力,并在一个包含 1700 对由专家标注的用户-参考视频的数据集上对最先进的 VLM 进行了基准测试,该数据集涵盖了 22 种力量和灵活性训练。为了加速 AI 驱动教练技术的研究,我们发布了该数据集以及一个自动化的、基于评分标准的评估流程,从而能够实现跨模型的标准化比较。我们的基准测试揭示了与人类水平教练相比存在的显著差距,突显了将细致入微、情境感知的运动分析集成到交互式 AI 系统中所面临的挑战与机遇。通过将姿态纠正构建为人与机器之间的协作与创造性过程,FormCoach 开启了具身 AI 的新前沿。
引用
@article{arxiv.2508.07501,
title = {FormCoach: Lift Smarter, Not Harder},
author = {Xiaoye Zuo and Nikos Athanasiou and Ginger Delmas and Yiming Huang and Xingyu Fu and Lingjie Liu},
journal= {arXiv preprint arXiv:2508.07501},
year = {2025}
}