K-Gen:基于多模态语言条件的方法用于可解释的关键点引导轨迹生成
人工智能
2026-03-06 v1
摘要
生成真实且多样化的轨迹是自动驾驶仿真中的关键挑战。虽然大型语言模型(LLM)显示出前景,但现有方法通常依赖结构化数据如矢量地图,这些数据无法捕捉场景中丰富的非结构化视觉上下文。为此,我们提出K-Gen,一种可解释的关键点引导的多模态框架,利用多模态大型语言模型(MLLM)统一矢量化BEV地图输入与文本场景描述。不同于直接预测完整轨迹,K-Gen生成沿轨迹的可解释关键点并伴随反映代理意图的推理,这些关键点随后由精炼模块细化为准确的轨迹。为进一步增强关键点生成,我们应用了T-DAPO,即轨迹感知强化微调算法。在WOMD和nuPlan上的实验表明,K-Gen超越了现有基线方法,凸显了结合多模态推理与关键点引导轨迹生成有效性。
引用
@article{arxiv.2603.04868,
title = {K-Gen: A Multimodal Language-Conditioned Approach for Interpretable Keypoint-Guided Trajectory Generation},
author = {Mingxuan Mu and Guo Yang and Lei Chen and Ping Wu and Jianxun Cui},
journal= {arXiv preprint arXiv:2603.04868},
year = {2026}
}