基于多孤岛临床笔记的 BERT 联邦预训练与微调
计算与语言
2020-02-21 v1 机器学习
摘要
大规模上下文表示模型(如 BERT)近年来显著推进了自然语言处理(NLP)。然而,在医疗等某些领域,由于隐私与监管原因,从多个机构获取多样化的大规模文本数据极具挑战性。在本文中,我们展示了可以以联邦方式利用来自不同孤岛(silo)的临床文本对 BERT 模型进行预训练与微调,而无需移动数据。
引用
@article{arxiv.2002.08562,
title = {Federated pretraining and fine tuning of BERT using clinical notes from multiple silos},
author = {Dianbo Liu and Tim Miller},
journal= {arXiv preprint arXiv:2002.08562},
year = {2020}
}