中文

持续学习的异常分布检测:设计原则与基准测试

软凝聚态物质 2025-12-24 v1 材料科学

摘要

近年来,随着计算资源的增加、大规模数据集的出现以及深度学习架构的兴起,机器学习模型在广泛领域取得了显著进展。从恶意软件检测到促进自动驾驶汽车导航,现代机器学习系统展现出惊人的能力。然而,随着这些模型部署到不断变化的真实世界场景中,它们在时间上保持可靠性和适应性的能力变得越来越重要。例如,在现实世界中,新的恶意软件家族不断被开发,而自动驾驶汽车则在许多不同的城市和天气条件下使用。在固定设置下训练的模型无法有效应对部署后遇到的新情况。事实上,大多数机器学习模型仍是在训练和测试数据独立同分布(i.i.d.)的假设下开发的,即从相同的底层(未知)分布中采样。虽然这种假设简化了模型的开发和评估,但在许多现实应用中都不成立,其中数据随时间变化且经常发生意外输入。每当新数据出现时,从头重新训练模型是计算昂贵、耗时且在资源受限的环境中难以实现的。这些局限性凸显了持续学习(CL)的需要,即允许模型从不断演变的数据流中增量学习而不忘记过往知识;以及异常分布检测(OOD)的需要,即允许系统识别和响应新出现的异常输入。同时应对这两大挑战对于开发稳健、高效且自适应的AI系统至关重要。

关键词

引用

@article{arxiv.2512.19724,
  title  = {Composition-agnostic prediction of self-assembly in multicomponent amphiphile mixtures from molecular structure},
  author = {Yuuki Ishiwatari and Takahiro Yokoyama and Tomoya Kojima and Taisuke Banno and Noriyoshi Arai},
  journal= {arXiv preprint arXiv:2512.19724},
  year   = {2025}
}

备注

33 pages, 8 figures