中文

从下一个标记预测到(STRIPS)世界模型

人工智能 2026-05-26 v7

摘要

我们研究了下一个标记预测是否能产生真正支持规划的世界模型,在受控的符号环境中,对 propositional STRIPS action models 从 action traces 中学习, correctness 可精确评估。我们引入了两种架构。第一种是 STRIPS Transformer,一种基于理论结果将 transformer 与 STRIPS 域的形式语言结构相吻合的符号对齐模型。第二种是一种无显式符号结构的标准 transformer 架构,我们研究了不同的 positional encoding 方案和 attention aggregation 机制。我们在五个经典规划域上评估两种架构,测量 training accuracy、generalization 和 planning performance across domains and problem sizes。有趣的是,两种方法都可以用于生成支持通过 off-the-shelf STRIPS planners 处理大量未见初始状态和目标的模型。尽管 STRIPS Transformer 包含强大的符号归纳偏好,但难以优化且需要更大数据集才能可靠地实现 generalisation。相比之下,带有 stick-breaking attention 的标准 transformer 在接近完美的 training accuracy 和强大的 generalisation 方面表现出色。最后,缺乏 stick-breaking attention 的标准 transformer 无法处理长轨迹,而从在较短轨迹上训练的 transformer 提取的符号 STRIPS 模型则能够。

关键词

引用

@article{arxiv.2509.13389,
  title  = {From Next Token Prediction to (STRIPS) World Models},
  author = {Carlos Núñez-Molina and Vicenç Gómez and Hector Geffner},
  journal= {arXiv preprint arXiv:2509.13389},
  year   = {2026}
}