使用条件随机场与长短期记忆网络进行医疗记录去标识化
计算与语言
2017-10-02 v2
摘要
CEGS N-GRID 2016 共享任务 1(临床自然语言处理)聚焦于精神科评估记录的去标识化。本文描述了我们团队参与的两个系统,分别基于条件随机场(CRF)和长短期记忆网络(LSTM)。在去标识化之前,引入了预处理模块用于句子检测与分词。对于 CRF,利用人工提取的丰富特征来训练模型。对于 LSTM,采用字符级双向 LSTM 网络来表示词元并为每个词元分类标签,随后堆叠一个解码层以解码最可能的受保护健康信息(PHI)术语。基于 LSTM 的系统获得了 89.86% 的 i2b2 严格微平均 指标,高于基于 CRF 的系统。
引用
@article{arxiv.1709.06901,
title = {De-identification of medical records using conditional random fields and long short-term memory networks},
author = {Zhipeng Jiang and Chao Zhao and Bin He and Yi Guan and Jingchi Jiang},
journal= {arXiv preprint arXiv:1709.06901},
year = {2017}
}