评估大型语言模型在医疗应用中的数值推理任务中的计算准确性
人工智能
2025-01-27 v1 计算与语言
机器学习
摘要
大型语言模型 (Large Language Models, LLMs) 已在医疗领域显示出作为变革性工具的能力,在自然语言理解和生成方面表现突出。然而,其在医疗应用中数值推理能力,特别是在临床应用中,仍未得到充分探索。数值推理在医疗应用中至关重要,影响患者结果、治疗计划和资源分配。本研究调查了 LLMs 在医疗语境下数值推理任务中的计算准确性。使用包含 1000 个数值问题的精选数据集,涵盖剂量计算和实验室结果解释等真实世界情景,评估了基于 GPT-3 架构的精炼 LLM 的性能。方法包括提示工程、事实检查管道的集成以及应用正则化技术以提高模型准确性和泛化能力。关键指标包括精确率、召回率和 F1 分数,用于评估模型的效果。结果表明整体准确率为 84.10%,在简单的数值任务中表现良好,在多步骤推理中存在挑战。事实检查管道的集成将准确率提高了 11%,凸显了验证机制的重要性。这项研究突显了 LLMs 在医疗数值推理中的潜力,并为进一步的细化以支持临床环境中的关键决策确定了方向。研究旨在为开发可靠、可解释且在上下文中相关的 AI 工具贡献于医疗领域。
引用
@article{arxiv.2501.13936,
title = {Evaluating Computational Accuracy of Large Language Models in Numerical Reasoning Tasks for Healthcare Applications},
author = {Arjun R. Malghan},
journal= {arXiv preprint arXiv:2501.13936},
year = {2025}
}
备注
13 pages, 1 figure, 2 tables