TRIP-Evaluate:面向交通领域大模型的开放多模态基准
计算机视觉与模式识别
2026-05-05 v1 人工智能
机器学习
摘要
大语言模型(LLM)和多模态大模型(MLLM)越来越多地用于交通任务,如法规问答、交通管理支持、工程审查和自动驾驶场景推理。然而,交通工作流程具有规则性强、计算密集、安全性高且固有多模态性等特点。现有通用基准无法提供模型是否正确应用法规、执行可验证工程计算或可靠解释交通场景的证据,而且现有的少数公共交通基准范围狭窄且很少支持跨文本、图像和点云数据的细粒度诊断。为此,我们提出 TRIP-Evaluate,一个面向交通领域大模型的开放多模态基准。该基准根据角色-任务-知识分类法组织 837 项内容,覆盖车辆、交通管理、乘客和规划设计等功能。每项均标注了能力、模态和难度标签,支持从整体准确率到特定失效模式的诊断。当前版本包含 596 项文本、198 项图像和 43 项点云数据。TRIP-Evaluate 还标准化了项目构建、质量控制、提示、解码和评分,以提高跨模型的可比性。对多样化模型面板的测试结果表明,文本表现正在改善,但在多步骤工程计算、规则约束推理、多模态场景理解和点云理解方面仍存在显著不足。总体而言,TRIP-Evaluate 提供了一个可复现、可诊断且符合工程要求的模型评估基准,适用于模型选择、回归测试和更安全的交通应用部署。
引用
@article{arxiv.2605.00907,
title = {TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation},
author = {Han Gong and Zhen Zhou and Yunyang Shi and Yan Tan and Jinbiao Huo and Qi Hong and Zhiyuan Liu},
journal= {arXiv preprint arXiv:2605.00907},
year = {2026}
}
备注
19 pages, 12 figures