大语言模型零样本推理与监督模型在乳腺癌病理分类中的比较研究
计算与语言
2024-01-26 v1 机器学习
摘要
尽管监督机器学习在从临床笔记中提取信息方面很受欢迎,但创建大型标注数据集需要广泛的领域专业知识且耗时。与此同时,大语言模型(LLM)展现出了有前景的迁移学习能力。在本研究中,我们探讨了近期的 LLM 能否减少对大规模数据标注的需求。我们整理了一个包含 769 份乳腺癌病理报告的人工标注数据集,标注了 13 个类别,以比较 GPT-4 模型和 GPT-3.5 模型的零样本分类能力与三种模型架构的监督分类性能:随机森林分类器、带注意力机制的长短期记忆网络(LSTM-Att)和 UCSF-BERT 模型。在所有 13 个任务中,GPT-4 模型的表现要么显著优于要么与最佳的监督模型(即 LSTM-Att 模型)相当(平均宏 F1 分数为 0.83 对 0.75)。在标签高度不平衡的任务上,差异更为显著。GPT-4 错误的常见来源包括来自多个样本的推断和复杂的任务设计。在无法轻易收集大型标注数据集的复杂任务上,LLM 可以减轻大规模数据标注的负担。然而,如果使用 LLM 受到限制,使用带有大型标注数据集的更简单的监督模型可以提供可比的结果。LLM 展现了通过减少对整理大型标注数据集的需求来加速临床 NLP 研究执行的潜力。这可能会促进观察性临床研究中基于 NLP 的变量和结果的使用增加。
引用
@article{arxiv.2401.13887,
title = {A comparative study of zero-shot inference with large language models and supervised modeling in breast cancer pathology classification},
author = {Madhumita Sushil and Travis Zack and Divneet Mandair and Zhiwei Zheng and Ahmed Wali and Yan-Ning Yu and Yuwei Quan and Atul J. Butte},
journal= {arXiv preprint arXiv:2401.13887},
year = {2024}
}