非英语小规模不平衡数据集中的放射学文本分类
计算与语言
2024-10-01 v1 人工智能
摘要
医学领域的自然语言处理(NLP)在涉及非英语语言小数据集的实际应用中可能表现不佳,这些数据集通常标记样本少且类别不平衡。目前对于如何处理这一问题尚无共识。我们评估了一组NLP模型,包括类BERT变换器、基于句子变换器的少样本学习(SetFit)以及提示式大语言模型(LLM),使用了三个关于丹麦语癫痫患者磁共振图像的放射学报告数据集(丹麦语是一种低资源语言)。我们的结果表明,在目标放射学报告领域预训练的类BERT模型在当前场景下提供了最优性能。值得注意的是,SetFit和LLM模型的性能均不如类BERT模型,其中LLM表现最差。重要的是,所研究的模型均未达到足够高的准确度,以允许在没有任何监督的情况下进行文本分类。然而,它们显示出在数据过滤方面的潜力,这可以减少所需的人工标注量。
引用
@article{arxiv.2409.20147,
title = {Classification of Radiological Text in Small and Imbalanced Datasets in a Non-English Language},
author = {Vincent Beliveau and Helene Kaas and Martin Prener and Claes N. Ladefoged and Desmond Elliott and Gitte M. Knudsen and Lars H. Pinborg and Melanie Ganz},
journal= {arXiv preprint arXiv:2409.20147},
year = {2024}
}