中文

描述-再行:通过蒸馏语言-动作世界模型实现主动代理引导

人工智能 2026-03-25 v1

摘要

部署安全关键型代理需要在执行动作前预见其后果。虽然世界模型提供了一种实现主动预见的范式,但当前依赖视觉模拟的方法往往延迟高昂,单个步骤耗时数秒。本文挑战了视觉处理是防止失效必需的假设。我们展示,训练后的策略的潜在状态结合其计划动作,已经包含足够的信息来预见动作结果,使视觉模拟对于防止失效冗余。在此基础上,我们引入 DILLO (DIstiLLed Language-ActiOn World Model),一个快速引导层,将范式从“模拟-再行”转为“描述-再行”。DILLO 通过跨模态蒸馏进行训练,其中受特权视觉语言模型教师在离线轨迹上注释,潜在条件大语言模型学生学习预测语义结果。这创建了仅限文本的推理路径,完全绕过重型视觉生成,实现对基线的 14 倍加速。在 MetaWorld 和 LIBERO 上的实验表明,DILLO 能够生成对下一个状态的高保真描述,并且能够引导策略,通过提升任务成功率,其中在某些任务上提高了最高可达 15pp。

关键词

引用

@article{arxiv.2603.23149,
  title  = {Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models},
  author = {Massimiliano Pappa and Luca Romani and Valentino Sacco and Alessio Palma and Stéphane Lathuilière and Fabio Galasso and Xavier Alameda-Pineda and Indro Spinelli},
  journal= {arXiv preprint arXiv:2603.23149},
  year   = {2026}
}