CellARC:用于衡量智能的细胞自动机
机器学习
2025-11-12 v1
摘要
我们介绍CellARC,这是一个由多色1维细胞自动机(CA)构建的抽象与推理基准测试。每个 episode 包含五对支持项和一个查询,序列化为256个标记,使小模型能够快速迭代,同时暴露可控的任务空间,包括字母表大小k、半径r、规则族、Langton's lambda、查询覆盖率和细胞熵等可调参数。我们发布了95k训练 episode 以及两个1k测试划分(插值/外推),并评估了符号、循环、卷积、Transformer、递归和LLM基线。CellARC将泛化与类人先验分离,支持无限难度可控采样,使在紧张预算下快速推断新规则成为可能。我们最强的小模型基线(10M参数 vanilla transformer)超过最近的递归模型(TRM、HRM),在插值/外推划分上分别达到58.0%/32.4%的 per-token 准确率;大型闭源模型(GPT-5 High)在100个测试任务的子集上达到62.3%/48.1%。一个在每个 episode 在Transformer和最佳符号基线之间选择的集成模型达到65.4%/35.5%,凸显了神经符号方法的互补性。排行榜:https://cellarc.mireklzicar.com
关键词
引用
@article{arxiv.2511.07908,
title = {CellARC: Measuring Intelligence with Cellular Automata},
author = {Miroslav Lžičař},
journal= {arXiv preprint arXiv:2511.07908},
year = {2025}
}
备注
22 pages, 11 figures. Working draft. Dataset and leaderboard available at https://cellarc.mireklzicar.com