GPT 模型在表型概念识别上的评估
计算与语言
2023-11-27 v2 人工智能
摘要
目的:临床深度表型分析和表型注释在罕见病患者诊断以及构建罕见病领域可计算知识方面起着关键作用。这些过程依赖于使用本体概念(通常来自人类表型本体)结合表型概念识别任务(通常由机器学习方法支持)来整理患者档案或现有科学文献。随着大语言模型(LLMs)在大多数 NLP 任务中的使用发生显著转变,我们考察了支撑 ChatGPT 的最新生成式预训练 Transformer(GPT)模型作为临床表型分析和表型注释任务基础的性能。材料与方法:本研究的实验设置包括七个不同具体程度的提示、两个 GPT 模型(gpt-3.5-turbo 和 gpt-4.0)以及两个已确立的表型识别黄金标准语料库,一个由出版摘要组成,另一个为临床观察。结果:我们的结果表明,在适当设置下,这些模型可以达到最先进的性能。使用少样本学习的最佳运行在出版摘要上取得了 0.58 的宏 F1 分数,在临床观察上取得了 0.75 的宏 F1 分数,前者与最先进水平相当,而后者超越了当前同类最佳工具。结论:尽管结果令人鼓舞,但输出的非确定性、高成本以及使用相同提示和输入的不同运行之间缺乏一致性,使得这些 LLMs 在该特定任务中的使用具有挑战性。
引用
@article{arxiv.2309.17169,
title = {An evaluation of GPT models for phenotype concept recognition},
author = {Tudor Groza and Harry Caufield and Dylan Gration and Gareth Baynam and Melissa A Haendel and Peter N Robinson and Christopher J Mungall and Justin T Reese},
journal= {arXiv preprint arXiv:2309.17169},
year = {2023}
}