中文

权衡与探索:统一大语言模型与局部微调模型在高度专业化放射学自然语言推理任务上的对比

计算与语言 2023-04-19 v1

摘要

近来,ChatGPT 和 GPT-4 因其在语言处理方面无与伦比的性能而涌现并获得了全球范围内的极大关注。尽管它们在各类开放领域任务中展现出令人印象深刻的能力,但其在放射学等高度专业领域的适用性仍未经检验。由于其专业性与复杂性,放射学呈现出不同于开放领域数据的独特语言现象。评估大语言模型(LLMs)在此类特定领域的性能,不仅对于全面评估其整体表现至关重要,也为未来的模型设计方向——模型设计应通用化还是领域专用化——提供了宝贵见解。为此,本研究评估了 ChatGPT/GPT-4 在放射学 NLI(自然语言推理)任务上的性能,并将其与在任务相关数据样本上专门微调的其他模型进行比较。我们还通过引入不同难度的推理层级,对 ChatGPT/GPT-4 的推理能力进行了全面调查。结果表明:1)GPT-4 在放射学 NLI 任务上优于 ChatGPT;2)其他专门微调的模型需要大量数据样本才能达到与 ChatGPT/GPT-4 相当的性能。这些发现表明,构建一个能够解决跨领域多种任务的通用模型是可行的。

关键词

引用

@article{arxiv.2304.09138,
  title  = {Exploring the Trade-Offs: Unified Large Language Models vs Local Fine-Tuned Models for Highly-Specific Radiology NLI Task},
  author = {Zihao Wu and Lu Zhang and Chao Cao and Xiaowei Yu and Haixing Dai and Chong Ma and Zhengliang Liu and Lin Zhao and Gang Li and Wei Liu and Quanzheng Li and Dinggang Shen and Xiang Li and Dajiang Zhu and Tianming Liu},
  journal= {arXiv preprint arXiv:2304.09138},
  year   = {2023}
}