从下一个标记预测到(STRIPS)世界模型
人工智能
2026-05-26 v7
摘要
我们研究了下一个标记预测是否能产生真正支持规划的世界模型,在受控的符号环境中,对 propositional STRIPS action models 从 action traces 中学习, correctness 可精确评估。我们引入了两种架构。第一种是 STRIPS Transformer,一种基于理论结果将 transformer 与 STRIPS 域的形式语言结构相吻合的符号对齐模型。第二种是一种无显式符号结构的标准 transformer 架构,我们研究了不同的 positional encoding 方案和 attention aggregation 机制。我们在五个经典规划域上评估两种架构,测量 training accuracy、generalization 和 planning performance across domains and problem sizes。有趣的是,两种方法都可以用于生成支持通过 off-the-shelf STRIPS planners 处理大量未见初始状态和目标的模型。尽管 STRIPS Transformer 包含强大的符号归纳偏好,但难以优化且需要更大数据集才能可靠地实现 generalisation。相比之下,带有 stick-breaking attention 的标准 transformer 在接近完美的 training accuracy 和强大的 generalisation 方面表现出色。最后,缺乏 stick-breaking attention 的标准 transformer 无法处理长轨迹,而从在较短轨迹上训练的 transformer 提取的符号 STRIPS 模型则能够。
引用
@article{arxiv.2509.13389,
title = {From Next Token Prediction to (STRIPS) World Models},
author = {Carlos Núñez-Molina and Vicenç Gómez and Hector Geffner},
journal= {arXiv preprint arXiv:2509.13389},
year = {2026}
}