结构化提示与多智能体知识蒸馏:用于交通视频解读与风险推断
计算机视觉与模式识别
2025-08-20 v1 人工智能
计算与语言
图像与视频处理
摘要
全面理解高速公路场景并实现稳健的交通风险推断是推动智能交通系统(ITS)和自动驾驶技术发展的关键。传统方法在可扩展性和泛化性方面常常困难,尤其是在现实环境的复杂动态条件下。为此,我们提出一种新颖的结构化提示与知识蒸馏框架,实现自动生成高质量的交通场景标注和情境风险评估。该框架通过结构化链式思考(Chain-of-Thought, CoT)策略,协调两个大型视觉语言模型(VLM)——GPT-4o 和 o3-mini,生成富有多视角的输出。这些输出作为带有知识丰富度的伪标注,用于监督性微调规模更小的学生 VLM。最终得到的3亿参数规模的紧凑模型,命名为 VISTA(Vision for Intelligent Scene and Traffic Analysis,即智能场景与交通分析视觉模型),能够理解低分辨率交通视频,生成语义忠实且具备风险感知能力的描述。尽管参数数量显著降低,VISTA 在与教师模型对比的标准描述度指标(BLEU-4、METEOR、ROUGE-L 和 CIDEr)上仍表现出色,证明了有效的知识蒸馏和结构化多智能体监督如何使轻量级 VLM 能够捕捉复杂推理能力。该紧凑的架构便于在边缘设备上部署,实现无需大规模基础设施升级的实时风险监控。
引用
@article{arxiv.2508.13439,
title = {Structured Prompting and Multi-Agent Knowledge Distillation for Traffic Video Interpretation and Risk Inference},
author = {Yunxiang Yang and Ningning Xu and Jidong J. Yang},
journal= {arXiv preprint arXiv:2508.13439},
year = {2025}
}
备注
16 pages, 10 figures, 1 table