中文

通过对抗序列验证生成模型中隐式世界模型

机器学习 2026-02-06 v1 人工智能

摘要

生成序列模型通常在来自自然或形式语言的样本序列上进行训练。whether -- or to what extent -- 基于样本的训练能否捕获这些语言的真实结构,常被称为“world model”。理论结果表明,我们最多只能期待其严格性,即生成有效的序列,但不一定生成所有序列。然而,仍然重要的是要有实用工具来验证给定序列模型的严格性。在本研究中,我们聚焦于棋局,因为它是一个在保持足够复杂性的同时拥有简单规则-based world model的领域。我们提出了用于验证序列模型严格性的对抗序列生成方法。我们的对手生成有效序列,以迫使序列模型生成无效的后续移动预测。除了严格性的否定之外,这种方法也适用于对失败模式和训练中不同选择的更细致的分析。在演示这一点方面,我们提出了若干对抗序列生成方法,并在大型棋局模型集合上进行评估。我们在随机以及高质量棋局游戏中训练模型,使用几种训练配方。我们发现,没有模型是严格的,但一些训练技术和数据集选择能够显著提高严格性。我们还研究了板状态探针在训练和攻击方法中的潜在应用。我们的发现表明,提取的板状态在大多数模型中没有在后续标记预测中的因果作用。

关键词

引用

@article{arxiv.2602.05903,
  title  = {Verification of the Implicit World Model in a Generative Model via Adversarial Sequences},
  author = {András Balogh and Márk Jelasity},
  journal= {arXiv preprint arXiv:2602.05903},
  year   = {2026}
}

备注

Accepted at ICLR 2026. Code, datasets, and models are available at https://github.com/szegedai/world-model-verification