用于车辆路径规划的行为固化终身学习
人工智能
2026-02-10 v4 机器学习
摘要
近期的神经求解器在学习求解路径规划问题上展现出了良好的性能。然而,现有研究主要基于对一个或一组预定义的问题分布和规模(即任务)的一次性训练。当新任务出现时,它们通常依赖于零样本泛化(由于新任务与训练任务之间的差异,其效果可能不佳),或者在新任务上微调预训练的求解器(这可能导致对先前任务所获知识的灾难性遗忘)。本文探索了一种针对神经VRP求解器的新型终身学习范式,其中具有不同分布和规模的多个任务随时间顺序出现。求解器需要有效且高效地学习求解新任务,同时保持其在先前学习任务上的性能。因此,提出了一种名为带有行为固化的终身学习路由器(LLR-BC)的新框架。LLR-BC通过以寻求决策的方式,将新任务上训练的求解器行为与缓冲的行为对齐,从而有效地固化先验知识。为了鼓励更多地关注关键经验,LLR-BC为置信度较低的决策分配更大的固化权重。在带容量车辆路径问题和旅行商问题上的大量实验表明,LLR-BC在终身学习设置下训练高性能神经求解器方面是有效的,能够解决灾难性遗忘问题,保持其可塑性,并提高零样本泛化能力。
引用
@article{arxiv.2509.21765,
title = {Lifelong Learning with Behavior Consolidation for Vehicle Routing},
author = {Jiyuan Pei and Yi Mei and Jialin Liu and Mengjie Zhang and Xin Yao},
journal= {arXiv preprint arXiv:2509.21765},
year = {2026}
}
备注
Accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026)