中文

获取更多数据会如何伤害:next-generation reservoir computing 中的不稳定性与正则化

机器学习 2025-07-08 v3 神经与进化计算 动力系统 适应与自组织系统

摘要

最近的研究发现,获取更多数据会以反直觉的方式损害深度神经网络的性能。本文我们进一步证明,这一现象在数据驱动的动力系统模型中呈现更为严重的形式。为阐明其背后的机制,我们聚焦于 next-generation reservoir computing (NGRC) —— 一种流行的用于从数据中学习动力学的框架。我们发现,尽管使用更多训练数据可以更好地学习流图的表示,但NGRC 可能会采用病态的“积分器”,导致稳定性丧失。我们将数据诱导的不稳定性与 NGRC 中延迟状态所创建的附加维度联系起来。基于这些发现,我们提出了两种简单的方法来缓解不稳定性:一种是随数据规模增加正则化强度,另一种是在训练过程中仔细引入噪声。我们的结果突显了在数据驱动的动力系统建模中正确正则化的重要性。

关键词

引用

@article{arxiv.2407.08641,
  title  = {How more data can hurt: Instability and regularization in next-generation reservoir computing},
  author = {Yuanzhao Zhang and Edmilson Roque dos Santos and Huixin Zhang and Sean P. Cornelius},
  journal= {arXiv preprint arXiv:2407.08641},
  year   = {2025}
}

备注

Published version