通过输入预测与误判纠正加速多模态 LLM 游戏性能
人工智能
2025-12-22 v1
摘要
实时顺序控制智能体常受到推理延迟的瓶颈制约。即使是每一步的微小计划延迟,也会导致控制不稳定并降低整体性能。我们提出一种 speculation-and-correction 框架,借鉴预测-验证式的投机执行思想,用于 model-based control 的 TD-MPC2。在每一步中,预训练的世界模型和潜在空间 MPC 规划器生成一短期动作队列以及预测的潜在 rollout,使智能体能够在无需立即重新规划的情况下执行多个计划动作。当新观察到达时,系统测量编码的真实潜在状态与排队预测潜在状态之间的偏差。对于小到中等偏差,轻量级学习型纠正器对投机动作施加残差更新,这些动作离线从重新规划教师中蒸馏出来。对于大偏差,智能体安全地回退到完整重新规划并清除过期的动作队列。我们研究了两种纠正器:一种是加盖两个塔 MLP 纠正器,一种是时序 Transformer 纠正器,以解决局部误差和系统漂移。在 DMC Humanoid-Walk 任务上实验表明,我们的方法将规划推理次数从 500 降低到 282,提高了端到端步骤延迟 25%,仅降低 7.1% 的回报,仍保持强大的控制性能。消融结果表明,缺乏纠正的投机执行在更长的时域内不可靠,凸显了针对鲁棒延迟降低所必需的偏差感知纠正。
引用
@article{arxiv.2512.17250,
title = {Accelerating Multi-modal LLM Gaming Performance via Input Prediction and Mishit Correction},
author = {Ziyang Lin and Zixuan Sun and Sanhorn Chen and Xiaoyang Chen and Roy Zhao},
journal= {arXiv preprint arXiv:2512.17250},
year = {2025}
}
备注
UIUC 25 Fall CS 498