去标识化实践
计算与语言
2017-01-13 v1
摘要
我们报告了利用自然语言处理和机器学习技术的最新进展,从医学文本中识别由HIPAA列出的数据项子集中的敏感信息的努力。我们用称为连续词袋(CBOW)的Word2Vec变体学习的高维连续向量表示单词。我们将词向量输入到具有长短期记忆(LSTM)架构的简单神经网络中。在没有任何提取手工特征的尝试,并且考虑到我们的医学数据集太小而无法输入神经网络的情况下,我们获得了有希望的结果。这些结果使我们兴奋地考虑在精确参数调优和其他可能改进下的大规模项目。
引用
@article{arxiv.1701.03129,
title = {De-identification In practice},
author = {Besat Kassaie},
journal= {arXiv preprint arXiv:1701.03129},
year = {2017}
}