面向非平稳环境的主动自适应 AI:数据漂移下的预测方法
机器学习
2025-05-01 v1 人工智能
摘要
部署在生产环境中的人工智能(AI)模型经常面临在非平稳环境中维持性能的挑战。这一问题在医疗领域尤为突出,因为时间数据漂移常常发生。这些漂移源于训练数据的分布与部署期间遇到的实际数据分布不同。此外,由于数据获取限制,新的标注数据以及时方式持续用于重新训练 AI 并不常见。为解决这些挑战,我们提出了一种主动自适应 AI 方法,即 pro-adaptive 方法,通过建模 AI 参数的时间轨迹,使我们能够对参数值进行短期预测。为此,我们在可扩展函数数据分析框架中使用多项式样条基。我们以 logistic 回归模型验证了该方法,针对先验概率漂移、协变漂移和概念漂移进行验证。该验证在受控模拟数据集和来自墨西哥的公开的新冠疫情数据集上进行,数据集中2020年至2024年间发生了各种漂移。我们的结果表明,该方法在不要求更新训练数据的情况下,显著提升了 AI 对于漂移的性能,对比不同时间距离的稳态模型训练。该工作为针对动态非平稳环境的 pro-adaptive AI 研究奠定了基础,能够在数据保护方面与韧性 AI 生产环境相容,尤其适用于医疗领域。
引用
@article{arxiv.2504.21565,
title = {Towards proactive self-adaptive AI for non-stationary environments with dataset shifts},
author = {David Fernández Narro and Pablo Ferri and Juan M. García-Gómez and Carlos Sáez},
journal= {arXiv preprint arXiv:2504.21565},
year = {2025}
}
备注
6 pages, 4 figures, conference paper