面向全球儿童发展的预训练编码器:迁移学习在数据稀缺环境下的部署
机器学习
2026-01-30 v1
摘要
每年有大量儿童经历可预防的发育迟缓,但由于数据瓶颈,机器学习在新国家的部署一直受阻:可靠模型需要数千个样本,而新项目通常开始时不到100个样本。我们介绍了面向全球儿童发展的首个预训练编码器,该编码器使用来自44个国家、357,709名儿童的UNICEF调查数据进行训练。仅使用50个训练样本,预训练编码器在不同地区的平均AUC为0.65(95%置信区间:0.56-0.72),在cold-start梯度提升法中取得0.61,提升了8-12%。当N=500时,编码器达到AUC为0.73。零样本部署到不可见国家可达到AUC最高为0.84。我们应用迁移学习界限来解释为何预训练的多样性使few-shot泛化成为可能。这些结果表明,预训练编码器可以改变在资源受限环境下进行SDG 4.2.1监测的可行性。
引用
@article{arxiv.2601.20987,
title = {Pre-trained Encoders for Global Child Development: Transfer Learning Enables Deployment in Data-Scarce Settings},
author = {Md Muhtasim Munif Fahim and Md Rezaul Karim},
journal= {arXiv preprint arXiv:2601.20987},
year = {2026}
}