AI 生成运动处方的跨模型一致性:跨三个大型语言模型的重复生成研究
计算与语言
2026-04-24 v2 人工智能
摘要
本研究在 temperature=0 条件下,比较了三个大型语言模型(LLM),即 GPT-4.1、Claude Sonnet 4.6 和 Gemini 2.5 Flash,在运动处方输出上的重复生成一致性。每个模型针对六种临床场景各生成 20 次处方,共产生 360 个输出,从语义相似度、输出可复现性、FITT 分类和安全性表达四个维度进行分析。GPT-4.1 的平均语义相似度最高(0.955),其次是 Gemini 2.5 Flash(0.950)和 Claude Sonnet 4.6(0.903),模型间差异显著(H = 458.41, p < .001)。关键在于,这些分数反映了根本不同的生成行为:GPT-4.1 产生了完全唯一的输出(100%)且语义内容稳定,而 Gemini 2.5 Flash 表现出明显的输出重复(仅 27.5% 的唯一输出),表明其高相似度分数源于文本复制而非一致的推理。因此,相同的解码设置产生了根本不同的一致性特征,这是单次输出评估无法捕捉的区别。所有模型的安全性表达均达到上限水平,证实了其作为区分指标的效用有限。这些结果表明,模型选择是一项临床决策而非仅仅是技术决策,并且在重复生成条件下的输出行为应被视为可靠部署基于 LLM 的运动处方系统的核心标准。
引用
@article{arxiv.2604.19598,
title = {Cross-Model Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Across Three Large Language Models},
author = {Kihyuk Lee},
journal= {arXiv preprint arXiv:2604.19598},
year = {2026}
}
备注
24 Pages, 2 Figures, 6 Tables and 2 Supplementary Materials. v2: Removed personal contact information