学习如何解 Rubik's Cube
机器学习
2026-05-19 v1 人工智能
计算机科学中的逻辑
摘要
尽管Cube-and-Conquer(C&C)在解决具有挑战性的布尔满足性(SAT)问题方面效果显著,但目前尚无工作表明基于Transformer的模型能够学习有效的Cube启发式方法。我们引入了一个 neuro-symbolic post-training 框架以实现此目标。我们设计了一个基于MCTS的数据精选管道,该管道使用符号启发式方法在SAT竞赛公式上探索分割决策,产生以求解器统计数据为基础的偏好数据,并增强来自教师模型的推理痕迹。我们的两阶段post-training流程,即监督微调(SFT)后跟直接偏好优化(DPO),使4B参数模型在100个SAT竞赛基准上实现53的pass@5得分,超越了Claude-Sonnet-4(50),并与最佳符号启发式方法(53)持平。消融实验表明,仅SFT即可将pass@5从46提高到51,DPO额外提升2个基准;在实现的第一次Cube决策上的熵/一致性消融实验进一步表明,SFT而非DPOaccount for产生覆盖每个运行的互补性的根本决策多样性,这种多样性超越确定性符号方法。该研究表明,Transformer可以被训练在传统由符号方法主导的领域中做出有效的Cube决策。
引用
@article{arxiv.2605.16632,
title = {Learning How to Cube},
author = {Ferhat Erata and Sam Kouteili and Thanos Typaldos and Timos Antonopoulos and Robert B. Jones and Byron Cook and Ruzica Piskac},
journal= {arXiv preprint arXiv:2605.16632},
year = {2026}
}
备注
33 pages, preprint