中文

基于直接偏好优化的多引导扩散模型用于交通情景生成

机器学习 2025-02-19 v1 多智能体系统

摘要

扩散模型因利用真实驾驶数据生成逼真且多样化的交通情景而受到广泛认可。这些模型通过引导采样融入特定交通偏好以提升情景逼真度。然而,引导采样以违背交通规则和偏好为导向,可能导致偏离真实交通先验,甚至引发不真实行为。为此,我们提出一种多引导扩散模型,通过新颖训练策略在多种引导组合下仍能紧密遵循交通先验。该模型采用多任务学习框架,使单个扩散模型能够处理多种引导输入。为提升引导采样精度,我们采用直接偏好优化(Direct Preference Optimization, DPO)算法进行微调。该算法基于引导得分优化偏好,有效应对引导采样微调过程中昂贵且常不可微的梯度计算复杂性。实验使用 nuScenes 数据集评估,结果表明该模型在交通情景生成的真实性、多样性和可控性之间取得了强有力的基准。

关键词

引用

@article{arxiv.2502.12178,
  title  = {Direct Preference Optimization-Enhanced Multi-Guided Diffusion Model for Traffic Scenario Generation},
  author = {Seungjun Yu and Kisung Kim and Daejung Kim and Haewook Han and Jinhan Lee},
  journal= {arXiv preprint arXiv:2502.12178},
  year   = {2025}
}