当 LLM 无法提供帮助:LLM 在营养领域的真实世界评估
人机交互
2025-11-27 v1 人工智能
计算机与社会
摘要
大语言模型(LLM),尤其是以聊天机器人形式出现的使用信任度不断提升,却因缺乏其外在评估而受到质疑。这在营养领域尤其如此,因为随机对照试验(RCT)是该领域的金标准,专家们要求进行此类试验以进行基于证据的部署。尽管 LLM 在该领域显示出令人期待的结果,但这些结果仅限于内在设置。我们通过进行首次涉及 LLM 的 RCT 来弥补这一差距。我们将基于规则的聊天机器人增强为两个 LLM 功能:(1)用于对话多样性和参与度的消息重述,(2)通过微调模型实现营养咨询。在本次 7 周、样本量为 81 的 RCT 中,我们比较了集成 LLM 与不集成 LLM 的聊天机器人变体。我们测量了对饮食结果、情感福祉和参与度的影响。尽管我们的 LLM 功能在内在评估中表现良好,但我们发现它们在真实世界部署中并未产生一致的益处。这一结果凸显了内在评估与真实世界影响之间的关键差距,强调了跨学科、以人为中心的方法的必要性。
引用
@article{arxiv.2511.20652,
title = {When LLMs Can't Help: Real-World Evaluation of LLMs in Nutrition},
author = {Karen Jia-Hui Li and Simone Balloccu and Ondrej Dusek and Ehud Reiter},
journal= {arXiv preprint arXiv:2511.20652},
year = {2025}
}
备注
Published at INLG 2025 main conference