临床文本分类中训练语料库大小的决定因素
计算与语言
2026-01-23 v1 机器学习
摘要
引言:使用自然语言处理模型进行临床文本分类需要充足的训练数据以达到最佳性能。为此,通常需要标注 200-500 份文档。这一数量受时间和成本的限制,且缺乏对样本量需求及其与文本词汇特性关系的论证。方法:我们使用包含以 ICD-9 诊断为标签的出院小结的公开 MIMIC-III 数据集,采用预训练的 BERT 嵌入和随机森林分类器来识别 10 个随机选择的诊断,将训练语料库大小从 100 份文档变化到 10,000 份文档,并通过在词袋嵌入上使用 Lasso 逻辑回归识别强预测词和噪声预测词来分析词汇特性。结果:尽管预处理和算法相同,但 10 个分类任务的学习曲线差异显著,对于所有任务,600 份文档足以达到使用 10,000 份文档可获得的 95% 的性能。词汇分析显示,更多的强预测词和更少的噪声预测词与更陡峭的学习曲线相关,其中每增加 100 个噪声词,准确率约下降 0.02,而每增加 100 个强预测词,最大准确率约提高 0.04。
引用
@article{arxiv.2601.15846,
title = {Determinants of Training Corpus Size for Clinical Text Classification},
author = {Jaya Chaturvedi and Saniya Deshpande and Chenkai Ma and Robert Cobb and Angus Roberts and Robert Stewart and Daniel Stahl and Diana Shamsutdinova},
journal= {arXiv preprint arXiv:2601.15846},
year = {2026}
}