中文

医院再入院预测中的噪声污染:基于强化学习的长文档分类

计算与语言 2020-05-26 v2 机器学习

摘要

本文提出一种强化学习方法,用于提取长临床文档中针对肾移植后再入院预测任务的噪声。我们面临在小数据集上开发鲁棒模型的挑战,其中每个文档可能包含超过 10K 个 token,且充满包括表格文本和与任务无关句子在内的噪声。我们首先实验四类编码器以经验性地确定最佳文档表示,然后应用强化学习从长文档中移除噪声文本,将噪声提取过程建模为序列决策问题。我们的结果表明,在此任务上旧的词袋编码器优于基于深度学习的编码器,且强化学习能够在剪枝掉 25% 文本段的同时优于基线。我们的分析表明,强化学习能够识别典型的噪声 token 以及任务特定的噪声文本。

关键词

引用

@article{arxiv.2005.01259,
  title  = {Noise Pollution in Hospital Readmission Prediction: Long Document Classification with Reinforcement Learning},
  author = {Liyan Xu and Julien Hogan and Rachel E. Patzer and Jinho D. Choi},
  journal= {arXiv preprint arXiv:2005.01259},
  year   = {2020}
}

备注

Accepted to the ACL Workshop on Biomedical Natural Language Processing, BioNLP 2020