AI-MASLD:非结构化临床叙事中大语言模型的代谢功能障碍与信息脂肪变性
人工智能
2025-12-15 v1
摘要
本研究旨在模拟真实临床场景,系统评估大语言模型(LLM)从充满噪声与冗余的患者主诉中提取核心医疗信息的能力,并验证其是否表现出类似于代谢功能障碍相关脂肪性肝病(MASLD)的功能衰退。我们采用基于标准化医学探针的横断面分析设计,选取四款主流 LLM 作为研究对象:GPT-4o、Gemini 2.5、DeepSeek 3.1 和 Qwen3-Max。使用包含五个核心维度共二十个医学探针的评估系统来模拟真实的临床沟通环境。所有探针均具有由临床专家定义的金标准答案,并由两名独立临床医生通过双盲反向评分量表进行评估。结果表明,所有受测模型均表现出不同程度的功能缺陷,其中 Qwen3-Max 展现出最佳的整体性能,Gemini 2.5 表现最差。在极端噪声条件下,多数模型出现功能崩溃。值得注意的是,GPT-4o 在评估继发于深静脉血栓(DVT)的肺栓塞(PE)风险时出现了严重误判。本研究首次通过实证确认 LLM 在处理临床信息时表现出类似于代谢功能障碍的特征,提出了“AI 代谢功能障碍相关脂肪性肝病(AI-MASLD)”的创新概念。这些发现为人工智能(AI)在医疗保健领域的应用提供了关键的安全警示,强调当前 LLM 必须在人类专家监督下作为辅助工具使用,因为其理论知识与实际临床应用之间仍存在显著差距。
引用
@article{arxiv.2512.11544,
title = {AI-MASLD Metabolic Dysfunction and Information Steatosis of Large Language Models in Unstructured Clinical Narratives},
author = {Yuan Shen and Xiaojun Wu and Linghua Yu},
journal= {arXiv preprint arXiv:2512.11544},
year = {2025}
}
备注
47 pages, 2 figures