中文

LangDriveCTRL:基于多模态智能体的自然语言可控驾驶场景编辑

计算机视觉与模式识别 2026-04-10 v2

摘要

LangDriveCTRL 是一个可通过自然语言控制来编辑真实驾驶视频,以合成多样化交通情景的框架。它将每个视频表示为显式的 3D 场景图,将场景分解为静态背景和动态对象节点。为实现细粒度编辑和真实性,引入了反馈驱动的智能体管道。Orchestrator 将用户指令转换为可执行的图,以协调专门的多模态智能体和工具。Object Grounding Agent 将自由形式的文本与场景图中的目标对象节点对齐;Behavior Editing Agent 从语言指令生成多对象轨迹;Behavior Reviewer Agent 持续审查和细化生成的轨迹。编辑后的场景图通过视频扩散工具进行渲染和和谐化,然后由 Video Reviewer Agent 进一步细化,以确保照片 realism 和外观对齐。LangDriveCTRL 支持对象节点编辑(移除、插入和替换)以及来自自然语言指令的多对象行为编辑。定量上,它实现了 nearly 2×2\times 高于以前 SoTA 的指令对齐,同时在照片 realism、结构保持和交通 realism 上均表现优异。项目页面地址:https://yunhe24.github.io/langdrivectrl/。

关键词

引用

@article{arxiv.2512.17445,
  title  = {LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents},
  author = {Yun He and Francesco Pittaluga and Ziyu Jiang and Matthias Zwicker and Manmohan Chandraker and Zaid Tasneem},
  journal= {arXiv preprint arXiv:2512.17445},
  year   = {2026}
}

备注

Project Page: https://yunhe24.github.io/langdrivectrl/