中文

日本全国医疗索赔基础模型:在模型规模与任务特定计算效率之间取得平衡

机器学习 2026-04-27 v1

摘要

使用纵向医疗数据进行临床风险预测支持个体化护理。自监督基础模型已成为利用大规模无标记医疗记录的有前景的方法。在自然语言处理领域,规模定律表明更大的模型可实现可预测的更低预训练损失,支持基础模型范式。然而,对于以有限词汇和稀疏观察为特征的结构化医疗数据,是否持续通过增加模型大小来改善下游预测效果尚不清楚,因为大多数研究仅评估单个模型规模。在本研究中,我们评估了模型规模与下游任务性能之间关系的效果。我们使用来自全国519家医院日文索赔数据库中230万名患者(32家医院)的随机样本,对用于疾病发生和药物预测的encoder-only Transformer在五个规模(220万-1.01亿参数)下进行预训练。下游性能在任务相关阈值处饱和:疾病预测受益于更大的模型(3200万-1.01亿参数),而药物预测在1100万参数处饱和,缩短了预训练时间178小时。在所有任务中,最佳模型始终在精确-召回曲线下面积方面超过Light Gradient Boosting Machine基线。这一发现表明,与单调递减的预训练损失不同,最佳模型规模取决于任务特征。该任务相关饱和为结构化医疗基础模型在预测性能和计算成本之间取得平衡提供了实用指导。

关键词

引用

@article{arxiv.2604.22348,
  title  = {A Nationwide Japanese Medical Claims Foundation Model: Balancing Model Scaling and Task-Specific Computational Efficiency},
  author = {Nanae Aratake and Taisei Tosaki and Yuji Okamoto and Eiichiro Uchino and Masaki Nakamura and Nobutomo Matsui and Akiko Hatakama and Yasushi Okuno},
  journal= {arXiv preprint arXiv:2604.22348},
  year   = {2026}
}

备注

14 pages, 5 figures, 3 tables