生理时间序列数据增强:以睡眠呼吸暂停检测为例
机器学习
2021-12-10 v1 信号处理
机器学习
摘要
健康领域的有监督机器学习应用常面临训练数据集不足的问题。由于隐私顾虑及医学专家采集与标注数据的成本,标注数据量很小。此外,所采集数据不平衡颇为常见,而获取足够数据以对个体模型个性化则极为昂贵甚至不可行。本文通过以下方式解决这些问题:(1) 设计循环生成对抗网络(Generative Adversarial Network, GAN)以生成逼真合成数据并增强原始数据集;(2) 基于高度不平衡数据集生成平衡数据集;(3) 控制数据生成使生成数据类似于特定个体的数据。我们将这些方案应用于睡眠呼吸暂停检测,并在评估中研究四种知名技术即 K 近邻(K-Nearest Neighbour)、随机森林(Random Forest)、多层感知机(Multi-Layer Perceptron)与支持向量机(Support Vector Machine)的性能。所有分类器在实验中敏感性一致提升,kappa 统计量提升介于 0.007 与 0.182 之间。
引用
@article{arxiv.1905.09068,
title = {Augmenting Physiological Time Series Data: A Case Study for Sleep Apnea Detection},
author = {Konstantinos Nikolaidis and Stein Kristiansen and Vera Goebel and Thomas Plagemann and Knut Liestøl and Mohan Kankanhalli},
journal= {arXiv preprint arXiv:1905.09068},
year = {2021}
}