中文

医疗研究中自然语言处理的样本量问题

机器学习 2023-09-06 v1

摘要

样本量计算是大多数基于数据的学科中的关键步骤。足够大的样本能确保对总体的代表性并确定估计的精度。这对于大多数定量研究都成立,包括那些采用机器学习方法(如自然语言处理)的研究,其中自由文本被用于生成预测和对文本实例进行分类。在医疗领域,先前收集的数据语料库不足可能成为确定新研究样本量的限制因素。本文试图通过针对医疗领域文本分类任务给出样本量建议来解决该问题。使用来自 Beth Israel Deaconess Medical Center 的重症监护记录 MIMIC-III 数据库训练的模型,将文档分类为是否含有未特指原发性高血压(该数据库中最常见的诊断代码)。使用不同分类器在不同样本量和类别比例下进行了模拟。对数据库中相对较不常见的诊断代码——未提及并发症的糖尿病,重复了上述过程。使用 K-nearest neighbours 分类器时,较小样本量获得了更好的结果,而使用支持向量机和 BERT 模型时,较大样本量提供了更好的结果。总体而言,大于 1000 的样本量足以提供良好的性能指标。本研究中进行的模拟提供了可作为构建文本医疗数据分类器时选择适当样本量和类别比例以及预测预期性能依据的指南。此处使用的方法可经修改用于其他数据集的样本量估计计算。

关键词

引用

@article{arxiv.2309.02237,
  title  = {Sample Size in Natural Language Processing within Healthcare Research},
  author = {Jaya Chaturvedi and Diana Shamsutdinova and Felix Zimmer and Sumithra Velupillai and Daniel Stahl and Robert Stewart and Angus Roberts},
  journal= {arXiv preprint arXiv:2309.02237},
  year   = {2023}
}

备注

Submitted to Journal of Biomedical Informatics