中文

离散域中的扩散-MPC:可行性约束、时域效应与评论家对齐——基于Tetris的案例研究

机器学习 2026-03-04 v1 人工智能 机器人学

摘要

我们研究了在离散组合域中应用基于扩散的模型预测控制(Diffusion-MPC)的方法,选取Tetris作为案例研究。我们的规划器通过MaskGIT式离散去噪器采样候选放置序列,并通过重新排序选择动作。我们分析了三个关键因素:(1)通过对有效放置的逻辑掩码实现可行性受限采样;(2)使用启发式得分、预训练DQN评论家以及混合组合方式的重新排序策略;(3)候选数量和规划时域的计算规模。我们发现,可行性掩码在离散域中是必需的,通过移除无效动作(占比46%),实现了6.8%的得分提升和5.6%的生存率提升。朴素的DQN重新排序系统性地与滚动质量不一致,产生高决策后悔(均值17.6,第90百分位36.6)。在稀疏和延迟奖励条件下,较短的规划时域优于较长的时域,表明长期想象滚动中的不确定性累积。总体而言,计算选择(K、H)决定了占主导地位的失败模式:小K限制了候选质量,而更大的H放大了误排序和模型不匹配。我们的发现揭示了扩散规划器在离散环境中面临的结构性挑战,并为评论家集成提供了实用诊断工具。

关键词

引用

@article{arxiv.2603.02348,
  title  = {Diffusion-MPC in Discrete Domains: Feasibility Constraints, Horizon Effects, and Critic Alignment: Case study with Tetris},
  author = {Haochuan Kevin Wang},
  journal= {arXiv preprint arXiv:2603.02348},
  year   = {2026}
}

备注

7 pages, 3 figures, 2 tables. Includes regret diagnostics and compute-quality frontier analysis. Code and experiment configurations available in the Diffusion-Tetris repository