基于潜在语义单元的零样本临床缩写展开
计算与语言
2020-11-16 v2 机器学习
摘要
我们提出潜在语义单元(Latent Meaning Cells, LMC),一种深度潜变量模型,其通过结合局部词法上下文与元数据来学习单词的上下文表示。元数据可指细粒度上下文(如章节类型),也可指更全局的上下文(如唯一文档标识)。在文本为半结构化且主题高度多变的临床领域,依赖元数据来进行上下文表示学习是恰当的。我们在三个数据集上的零样本临床缩写展开任务中评估了 LMC 模型。LMC 以极小的预训练成本显著优于一组多样的基线模型,并学习到临床连贯的表示。我们证明,不仅元数据本身对该任务非常有帮助,而且 LMC 推断算法还带来了额外的巨大收益。
引用
@article{arxiv.2010.02010,
title = {Zero-Shot Clinical Acronym Expansion via Latent Meaning Cells},
author = {Griffin Adams and Mert Ketenci and Shreyas Bhave and Adler Perotte and Noémie Elhadad},
journal= {arXiv preprint arXiv:2010.02010},
year = {2020}
}
备注
To appear in Proceedings Track for Machine Learning for Health (ML4H) Workshop at NeurIPS (2020)