中文

利用机器学习增强有害藻华检测的合成数据扩充

机器学习 2025-06-17 v1 人工智能 计算机与社会

摘要

有害藻华(HABs)对水生生态系统和公众健康构成严重威胁,在全球范围内造成巨大的经济损失。早期检测至关重要,但常常因训练可靠机器学习(ML)模型所需的高质量数据集匮乏而受阻。本研究探讨了利用 Gaussian Copulas 进行合成数据扩充以增强基于 ML 的 HAB 检测系统。使用相关环境特征——水温、盐度和 UVB 辐射——以及校正后的叶绿素-a 浓度作为目标变量,生成了不同规模(100-1000 个样本)的合成数据集。实验结果表明,适度的合成扩充显著提升了模型性能(RMSE 从 0.4706 降至 0.1850;p<0.001p < 0.001)。然而,过量的合成数据会引入噪声并降低预测准确性,强调了数据扩充需要采取平衡方法。这些发现凸显了合成数据在增强 HAB 监测系统方面的潜力,为生态和公众风险的早期检测与缓解提供了一种可扩展且经济高效的方法。

关键词

引用

@article{arxiv.2503.03794,
  title  = {Synthetic Data Augmentation for Enhancing Harmful Algal Bloom Detection with Machine Learning},
  author = {Tianyi Huang},
  journal= {arXiv preprint arXiv:2503.03794},
  year   = {2025}
}

备注

Accepted Paper at the 2025 IEEE Conference on Technologies for Sustainability (SusTech)