面向健康与健康领域的大语言模型开发与评估:基于原则的框架
人机交互
2025-12-11 v1 人工智能
计算机与社会
摘要
将生成式人工智能融入个人健康应用,为个人化、数据驱动的健康与健身指导带来变革性机遇,但也带来用户安全、模型准确性和个人隐私等挑战。为此,开发并验证了一种新型、基于原则的框架,用于系统评估应用于个人健康与健康的大语言模型。首先,描述了Fitbit Insights explorer——一个旨在帮助用户解读个人健康数据的大语言模型(LLM)驱动系统。随后,引入基于原则的框架(SHARP),作为一种贯穿整个开发生命周期的端到端操作方法,整合了包括普通用户和临床专家的人类评估、自动评分器评估和对抗性测试等全面的评估技术。通过将该框架应用于Fitbit Insights explorer,并在涉及超过13,000名准许可用户的分阶段部署中,系统性地识别出初始测试中未显现的挑战。这一过程指导了针对性性的系统改进,证明了将孤立的技术评估与真实用户反馈结合的必要性。最后,确立了一套全面且可操作的方法,为负责任地开发和部署大语言模型驱动的健康应用提供标准化方法,推动创新,同时确保新兴技术对用户安全、有效且可信赖。
引用
@article{arxiv.2512.08936,
title = {A Principle-based Framework for the Development and Evaluation of Large Language Models for Health and Wellness},
author = {Brent Winslow and Jacqueline Shreibati and Javier Perez and Hao-Wei Su and Nichole Young-Lin and Nova Hammerquist and Daniel McDuff and Jason Guss and Jenny Vafeiadou and Nick Cain and Alex Lin and Erik Schenck and Shiva Rajagopal and Jia-Ru Chung and Anusha Venkatakrishnan and Amy Armento Lee and Maryam Karimzadehgan and Qingyou Meng and Rythm Agarwal and Aravind Natarajan and Tracy Giest},
journal= {arXiv preprint arXiv:2512.08936},
year = {2025}
}