第一步猜测往往不是最终答案:针对旅行推销员问题学习搜索
机器学习
2026-05-04 v2 人工智能
摘要
大多数针对旅行推销员问题(TSP)的神经求解器在训练时仅输出单个解,但实际应用中往往不会如此:测试时会常规地进行额外计算以进行抽样或事后搜索。这自然提出了一个问题:搜索过程本身是否可以被学习?神经改进方法持此视角,通过学习策略来应用对候选解的局部修改,在改进轨迹上累积收益。然而,TSP上的学习式改进仍相对不成熟,现有方法在鲁棒性和可扩展性方面仍不足。我们认为关键原因在于设计不匹配:许多方法复用了来自单解方法的状态表示、架构选择和训练配方,而非围绕局部搜索的机制进行构建。此不匹配激发了NICO-TSP(Neural Improvement for Combinatorial Optimization,即组合优化神经改进):TSP的2-opt改进框架。NICO-TSP以恰好n个边标记表示当前路径,边标记与邻域算子对齐,直接对2-opt动作打分,无需路径位置编码。训练采用两阶段程序:模仿学习以短程最优轨迹为目标,随后采用无评论家的基于群体的强化学习处理更长的滚动。以计算匹配评估衡量改进(以搜索步数和墙钟时间为函数),NICO-TSP在改进上持续优于先前学习型和启发式搜索基准,更高效;对更大分布外实例的泛化更可靠;既可作为经典局部搜索的竞争性替代方案,也可作为构造求解器的强大测试时精炼模块。
引用
@article{arxiv.2604.06940,
title = {A First Guess is Rarely the Final Answer: Learning to Search in the Traveling Salesperson Problem},
author = {Andoni Irazusta Garmendia},
journal= {arXiv preprint arXiv:2604.06940},
year = {2026}
}