利用 MIMIC 数据集提升数字健康:面向开放问题的综述
计算机视觉与模式识别
2025-06-17 v1
摘要
Medical Information Mart for Intensive Care (MIMIC) 数据集已成为数字健康研究的内核,通过提供来自数万例重症监护 admission 的免费可访问的去标识化记录,使其能够在临床决策支持、结果预测和医疗保健分析等广泛应用场景中发挥作用。尽管已有大量研究和调查探索了 MIMIC 基于模型的预测能力和临床实用性,但数据集成、表示和互操作性方面的关键挑战仍未得到充分探讨。本文提出了一项综合性调查,独特地聚焦于开放问题。我们识别出诸如数据细粒度、基数限制、异构编码方案以及伦理约束等持久问题,这些问题阻碍了机器学习模型的普遍可行性和实时实现。我们概述了在维度缩减、时序建模、因果推断和隐私保护分析方面的关键进展,同时也勾勒了包括混合建模、联邦学习和标准化预处理管道等前景广阔的方向。通过批判性地审视这些结构性限制及其影响,本次调查为引领下一代基于 MIMIC 的数字健康创新提供了可操作性见解。
引用
@article{arxiv.2506.12808,
title = {Leveraging MIMIC Datasets for Better Digital Health: A Review on Open Problems, Progress Highlights, and Future Promises},
author = {Afifa Khaled and Mohammed Sabir and Rizwan Qureshi and Camillo Maria Caruso and Valerio Guarrasi and Suncheng Xiang and S Kevin Zhou},
journal= {arXiv preprint arXiv:2506.12808},
year = {2025}
}