中文

评估 ChatGPT 在医学信息抽取任务中的表现:性能、可解释性等

计算与语言 2026-02-12 v2

摘要

大型语言模型 (LLM) 如 ChatGPT 在理解用户意图和生成合理且有用的响应方面展现了惊人的能力。除了其聊天能力外,它们在各种自然语言处理 (NLP) 任务中的能力也备受关注。本文聚焦于评估 ChatGPT 在 4 项医学信息抽取 (MedIE) 任务中的整体能力,这些任务跨越 6 个基准数据集。我们通过衡量 ChatGPT 的性能、可解释性、置信度、忠实度和不确定性,对其进行系统性分析。我们的实验揭示了以下结论:(a) ChatGPT 在 MedIE 任务上的性能得分落后于微调基线模型;(b) ChatGPT 可以提供高质量的决策解释,然而 ChatGPT 在预测中显得过于自信;(c) ChatGPT 在大多数情况下表现出高度的忠实性;(d) 生成过程中的不确定性导致信息抽取结果的不确定性,从而可能阻碍其在 MedIE 任务中的应用。

关键词

引用

@article{arxiv.2601.21767,
  title  = {Evaluating ChatGPT on Medical Information Extraction Tasks: Performance, Explainability and Beyond},
  author = {Liz Li and Wei Zhu},
  journal= {arXiv preprint arXiv:2601.21767},
  year   = {2026}
}