中文

大语言模型准备好用于医疗健康了吗?一项关于临床语言理解的比较研究

计算与语言 2023-08-01 v3 人工智能

摘要

大语言模型(LLMs)在包括医疗健康在内的多个领域取得了显著进展。然而,临床语言理解任务的专门性质带来了独特的挑战和局限,值得进一步研究。在本研究中,我们对最先进的LLMs(即GPT-3.5、GPT-4和Bard)在临床语言理解任务范围内进行了全面评估。这些任务涵盖广泛,包括命名实体识别、关系抽取、自然语言推理、语义文本相似度、文档分类和问答。我们还引入了一种新颖的提示策略,即自提问提示(SQP),旨在通过引出与当前临床场景相关的信息性问题和答案来增强LLMs的性能。我们的评估强调了任务特定学习策略和提示技术对于提升LLMs在医疗相关任务中有效性的重要性。此外,我们对具有挑战性的关系抽取任务的深入错误分析为错误分布及利用SQP改进的潜在途径提供了宝贵见解。我们的研究揭示了在医疗这一专门领域应用LLMs的实际意义,为未来研究及医疗环境中潜在应用的开发奠定了基础。

关键词

引用

@article{arxiv.2304.05368,
  title  = {Are Large Language Models Ready for Healthcare? A Comparative Study on Clinical Language Understanding},
  author = {Yuqing Wang and Yun Zhao and Linda Petzold},
  journal= {arXiv preprint arXiv:2304.05368},
  year   = {2023}
}

备注

24 pages