中文

用于机器学习的重要 ICD-10 代码识别的无监督特征选择:基于冠心病患者队列的案例研究

机器学习 2024-10-29 v1 人工智能

摘要

由于国际疾病分类(ICD)系统代码数量庞大,在医疗中使用 ICD 代码作为机器学习模型特征时,选择相关代码构成一项挑战。本研究比较了针对加拿大阿尔伯塔省 49,075 名冠心病患者 ICD 代码数据库的若干无监督特征选择方法。具体而言,我们采用拉普拉斯得分(Laplacian Score)、多簇数据无监督特征选择(Unsupervised Feature Selection for Multi-Cluster Data)、自编码器启发的无监督特征选择(Autoencoder Inspired Unsupervised Feature Selection)、主特征分析(Principal Feature Analysis),以及带与不带 ICD 树权重调整的crete 自编码器(Concrete Autoencoders),从超过 9,000 个代码中选出 100 个最佳特征。我们根据所选特征重构初始特征空间及预测出院后 90 天死亡率的能力进行评估。我们的发现表明,Concrete Autoencoder 方法在两项任务中均优于所有其他方法。此外,Concrete Autoencoder 方法中的权重调整降低了特征的复杂度。

关键词

引用

@article{arxiv.2303.14303,
  title  = {Unsupervised Feature Selection to Identify Important ICD-10 Codes for Machine Learning: A Case Study on a Coronary Artery Disease Patient Cohort},
  author = {Peyman Ghasemi and Joon Lee},
  journal= {arXiv preprint arXiv:2303.14303},
  year   = {2024}
}

备注

Submitted to AMIA 2023 Conference