从3D姿态到文字:基于生物力学的视觉-语言教练
计算机视觉与模式识别
2026-03-31 v1
摘要
我们提出BioCoach——一个基于生物力学的视觉-语言框架,用于从实时视频进行健身教练。BioCoach通过三级管道融合视觉外观与3D骨骼动力学:针对关键关节的运动-自由度选择器聚焦分析;结构化的生物力学背景将个体化体形与周期和约束分析相结合;视觉-生物力学条件化反馈模块通过交叉注意力生成精确、可操作的文本。采用参数高效训练冻结视觉和语言主干,BioCoach实现透明、个性化的推理而非模式匹配。在学习和公平评估方面,我们将QEVD-fit-coach增强为生物力学导向反馈以创建QEVD-bio-fit-coach,并引入生物力学敏感的LLM评判指标。BioCoach在QEVD-bio-fit-coach上实现词汇和判断指标的显著提升,同时维持时序触发;在原始QEVD-fit-coach上,它在文本质量和正确性方面均取得明显进步,时序几乎持平,表明显式的动力学和约束是实现准确、阶段感知教练的关键。
引用
@article{arxiv.2603.26938,
title = {From 3D Pose to Prose: Biomechanics-Grounded Vision--Language Coaching},
author = {Yuyang Ji and Yixuan Shen and Shengjie Zhu and Yu Kong and Feng Liu},
journal= {arXiv preprint arXiv:2603.26938},
year = {2026}
}