用于临床笔记表示学习稀疏性降低的自编码器适配
机器学习
2022-09-27 v1 计算与语言
信号处理
摘要
在处理小数据集上的临床文本分类时,近期研究证实,调优良好的多层感知机优于其他生成式分类器,包括深度学习分类器。为提高神经网络分类器的性能,可有效使用学习表示的特徵选择。然而,大多数特徵选择方法仅估计变量间的线性依赖程度,并基于单变量统计检验选择最佳特徵。此外,学习表示中涉及的特征空间稀疏性被忽视。目标:因此,我们的目标是通过压缩临床表示特征空间来探索一种替代方法以应对稀疏性,其中有限的法语临床笔记也能被有效处理。方法:本研究提出一种自编码器学习算法,以利用临床笔记表示中的稀疏性降低。动机在于确定如何通过降低临床笔记表示特征空间的维度来压缩稀疏的高维数据。随后在训练且压缩的特征空间中对分类器的分类性能进行评估。结果:所提方法使各项评估的总体性能提升高达 3%。最终,该分类器在检测患者状况时达到 92% 准确率、91% 召回率、91% 精确率和 91% f1-score。此外,通过应用理论信息瓶颈框架,展示了压缩工作机制与自编码器预测过程。
引用
@article{arxiv.2209.12831,
title = {Adaptation of Autoencoder for Sparsity Reduction From Clinical Notes Representation Learning},
author = {Thanh-Dung Le and Rita Noumeir and Jerome Rambaud and Guillaume Sans and Philippe Jouvet},
journal= {arXiv preprint arXiv:2209.12831},
year = {2022}
}
备注
Submitted to IEEE journal for review