中文

评估 GPT-4 与 ChatGPT 在日本医师国家考试中的表现

计算与语言 2023-04-06 v2

摘要

随着大语言模型(LLMs)在不同语言使用者中日益普及,我们认为对其基准测试至关重要,以更好理解英语之外语言下的模型行为、失败与局限。本工作中,我们评估了过去五年(含本年)日本医师国家考试中的 LLM API(ChatGPT、GPT-3 与 GPT-4)。我们的团队由母语为日语的 NLP 研究人员及一名在日本执业的心脏病专家组成。实验显示 GPT-4 优于 ChatGPT 与 GPT-3,并通过了全部六年的考试,凸显了 LLMs 在类型学上远离英语的语言中的潜力。然而,我们的评估也暴露了当前 LLM API 的关键局限。首先,LLMs 有时会选择在日本医疗实践中应严格避免的禁忌选项,例如建议安乐死。进一步,我们分析表明,由于当前流水线中对非拉丁文字的切分方式,日语的 API 成本普遍更高且最大上下文长度更小。我们发布了基准 Igaku QA 以及所有模型输出与考试元数据。希望我们的结果与基准能推动 LLMs 更多样化应用的进展。我们的基准位于 https://github.com/jungokasai/IgakuQA。

关键词

引用

@article{arxiv.2303.18027,
  title  = {Evaluating GPT-4 and ChatGPT on Japanese Medical Licensing Examinations},
  author = {Jungo Kasai and Yuhei Kasai and Keisuke Sakaguchi and Yutaro Yamada and Dragomir Radev},
  journal= {arXiv preprint arXiv:2303.18027},
  year   = {2023}
}

备注

Added results from the March 2023 exam