AI生成运动处方的稳定性:基于大语言模型的重复生成研究
人工智能
2026-04-14 v1 其他定量生物学
摘要
背景:大语言模型已被探索作为生成个性化运动处方的工具,但在相同条件下输出的稳定性尚未得到充分检验。目的:本研究采用重复生成设计,评估了LLM生成运动处方的模型内稳定性。方法:使用Gemini 2.5 Flash基于六个临床场景生成运动处方(每个场景20个输出;总计n=120)。从三个维度评估稳定性:(1) 基于SBERT余弦相似度的语义稳定性,(2) 基于FITT原则并使用AI作为评判的结构稳定性,以及(3) 安全性表达稳定性,包括包含率和句子级量化。结果:各场景的语义相似度较高(平均余弦相似度:0.879-0.939),在临床受限案例中一致性更高。频率表现出一致模式,而定量成分(特别是运动强度)则观察到变异性。在10-25%的抗阻训练输出中观察到无法分类的强度表达。安全性相关表达出现在100%的输出中;然而,安全语句数量在不同场景间差异显著(H=86.18,p<0.001),临床案例生成的安全表达多于健康成人案例。结论:LLM生成的运动处方表现出较高的语义稳定性,但在关键定量成分上存在变异性。可靠性在很大程度上取决于提示结构,在临床部署前需要额外的结构约束和专家验证。
引用
@article{arxiv.2604.11287,
title = {Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Using a Large Language Model},
author = {Kihyuk Lee},
journal= {arXiv preprint arXiv:2604.11287},
year = {2026}
}
备注
15 pages, 5 tables, 3 figures