中文

边缘机器学习中的数据质量:面向数据质量综述

机器学习 2024-06-06 v1 人工智能 机器学习

摘要

数据驱动的人工智能(AI)系统通过机器学习(ML)训练,正在塑造我们生活中日益增长(在规模和重要性方面)的部分,包括但不限于推荐系统、自动驾驶技术、医疗诊断、金融服务和个人化营销。一方面,这些系统的巨大影响力提升了对数据质量的高标准,尤其是用于训练它们的数据。另一方面,由于边缘计算和物联网设备的普及以及日益增长的用于训练和部署 ML 模型的采用,建立和维护数据质量(DQ)标准变得更加具有挑战性。边缘环境的特性——受限的资源、去中心化的数据存储和处理——加剧了数据相关问题的频发性、严重性和检测与缓解的难度。由此推断,针对边缘 ML 的 DQ 研究是确保当前和未来 AI 系统安全及实用性的关键且紧迫的探索方向。尽管如此,针对边缘 ML 的 DQ 研究仍处于初级阶段。该领域的文献仍在不同研究社区中碎片化,迄今为止尚无综合性调查。因此,本文旨在填补这一空白,通过提供来自多个学科的现有文献全局视图,这些文献可归类为 DQ 面向边缘 ML 的 umbrella。具体而言,我们提出了边缘计算中数据质量的一种暂定定义,并据此建立了一组 DQ 维度。我们详细探讨了每个维度,包括缓解措施。

关键词

引用

@article{arxiv.2406.02600,
  title  = {Data Quality in Edge Machine Learning: A State-of-the-Art Survey},
  author = {Mohammed Djameleddine Belgoumri and Mohamed Reda Bouadjenek and Sunil Aryal and Hakim Hacid},
  journal= {arXiv preprint arXiv:2406.02600},
  year   = {2024}
}

备注

31 pages, 5 figures