中文

梯度引导假设:一种在稀缺和噪声数据场景下赋能机器学习模型的统一解决方案

机器学习 2024-05-30 v1 人工智能

摘要

确保高质量数据对于最大化机器学习模型和商业智能系统的性能至关重要。然而,数据质量方面的挑战,包括数据采集中的噪声、缺失记录、有限的数据生产以及混杂变量,严重限制了这些系统的潜在性能。在本研究中,我们提出了一种与架构无关的算法——梯度引导假设(GGH),旨在解决这些挑战。GGH将来自假设的梯度分析作为数据中不同且可能矛盾模式的代理。该框架在机器学习训练中引入了一个额外步骤,其中梯度可以被包含或排除在反向传播之外。通过这种方式,缺失数据和噪声数据通过一个统一的解决方案得到处理,该方案将这两个挑战视为同一根本问题的不同方面:错误信息的传播。使用真实世界的开源数据集对GGH进行了实验验证,其中模拟了缺失率高达98.5%的记录。与最先进的插补方法的比较分析表明,GGH显著提升了模型性能。特别是在极高稀缺性场景下,GGH被发现是唯一可行的解决方案。此外,通过向数据集中引入模拟噪声并观察过滤噪声数据后模型性能的提升,展示了GGH的噪声检测能力。本研究将GGH作为在各种应用中提高数据质量和模型性能的有前景的解决方案。

关键词

引用

@article{arxiv.2405.19210,
  title  = {Gradient Guided Hypotheses: A unified solution to enable machine learning models on scarce and noisy data regimes},
  author = {Paulo Neves and Joerg K. Wegner and Philippe Schwaller},
  journal= {arXiv preprint arXiv:2405.19210},
  year   = {2024}
}