AI健康建议的情境影响程度
综合经济学
2026-02-25 v2 人工智能
计算机与社会
人机交互
机器学习
经济学
摘要
大型语言模型(LLM)日益被用于提供健康建议,但关于其准确性在不同语言、主题和信息来源上的变化仍缺乏证据。我们评估了语言和情境因素如何影响基于AI的健康主张验证的准确性。我们在两个数据集上评估了七个广泛使用的LLM:(i)来自UK和EU监管寄存器的1975个合法授权营养和健康主张,翻译成21种语言; (ii)来自PUBHEALTH语料库的9088个记者审核的公共健康主张,涵盖新冠疫情、人口礼仪、政治和一般健康,来源于政府建议、科学摘要和媒体来源。模型对每项主张进行分类,判定为支持或不支持,使用跨重复运行的多数投票。按语言、主题、来源和模型分析准确性。在授权主张上,准确性在英语及相关欧洲语言中最高,在几个广泛使用的非欧洲语言中下降,随着与英语的句法距离增加而下降。在现实世界的公共健康主张上,准确性明显较低,按主题和来源系统性变化。在新冠疫情和政府归因的主张上表现最佳,在一般健康和科学摘要上表现最差。高绩效的英语、规范健康主张掩盖了在具体情境下 substantial 的差距。训练数据的暴露、编辑框架和主题特定调优可能导致这些差异,其规模相当于跨语言差异。LLM在健康主张验证中的准确性在语言、主题和信息来源方面高度依赖。英语语言性能并不一定可靠地概括跨情境的表现,强调在部署于公共卫生传播前需进行多语言、特定领域的评估。
引用
@article{arxiv.2504.18310,
title = {How much does context affect the accuracy of AI health advice?},
author = {Prashant Garg and Thiemo Fetzer},
journal= {arXiv preprint arXiv:2504.18310},
year = {2026}
}