中文

ECG揭秘:真实世界ECG数据集中的客户端重识别风险分析

信号处理 2024-08-21 v1 机器学习

摘要

虽然ECG数据对于诊断和治疗心脏疾病至关重要,但它也包含独特的生物特征信息,带来显著的隐私风险。现有的ECG重识别研究依赖于对大量深度学习特征的穷举分析,仅限于向临床医生提供临时性的可解释性。在本工作中,我们利用透明的机器学习模型来探讨ECG重识别风险的可解释性。我们使用SHapley Additive exPlanations (SHAP)分析来识别和解释对重识别风险贡献最大的关键特征。我们对来自五个不同真实世界数据集的ECG数据进行了身份重识别风险的实证分析,涵盖223名参与者。通过采用透明的机器学习模型,我们揭示了不同ECG特征在个体重识别中的差异性贡献,其中性别识别准确率为0.76,年龄组识别准确率为0.67,参与者ID重识别准确率为0.82。我们的方法为临床专家提供了有价值的见解,并指导有效隐私保护机制的开发。此外,我们的发现强调了在真实世界健康应用中采取稳健隐私措施的必要性,并为改进数据匿名化技术提供了详细的可操作见解。

关键词

引用

@article{arxiv.2408.10228,
  title  = {ECG Unveiled: Analysis of Client Re-identification Risks in Real-World ECG Datasets},
  author = {Ziyu Wang and Anil Kanduri and Seyed Amir Hossein Aqajari and Salar Jafarlou and Sanaz R. Mousavi and Pasi Liljeberg and Shaista Malik and Amir M. Rahmani},
  journal= {arXiv preprint arXiv:2408.10228},
  year   = {2024}
}