基于 BERT 的序列标注模型在中文医疗文本属性抽取中的应用
计算与语言
2020-08-25 v1
摘要
我们将中文医疗文本属性抽取任务转化为序列标注或机器阅读理解任务。基于 BERT 预训练模型,我们不仅尝试了广泛使用的 LSTM-CRF 序列标注模型,还尝试了其他序列模型,如 CNN、UCNN、WaveNet、SelfAttention 等,其达到了与 LSTM+CRF 相似的性能。这为传统序列标注模型带来启示。由于不同序列标注模型关注的重点差异显著,集成这些模型为最终系统增添了多样性。通过这种方式,我们的系统在中文医疗文本属性抽取任务(CCKS 2019 任务1的子任务2)上取得了良好性能。
引用
@article{arxiv.2008.09740,
title = {Applications of BERT Based Sequence Tagging Models on Chinese Medical Text Attributes Extraction},
author = {Gang Zhao and Teng Zhang and Chenxiao Wang and Ping Lv and Ji Wu},
journal= {arXiv preprint arXiv:2008.09740},
year = {2020}
}
备注
in Chinese language