STER-VLM:基于增强参考的时空视觉语言模型
计算机视觉与模式识别
2025-08-20 v1 人工智能
摘要
视觉语言模型(VLMs)已涌现出强大的工具,用于自动化交通分析;然而,当前方法往往需要大量计算资源且在细粒度时空理解方面存在挑战。本文介绍STER-VLM,一个计算效率高的框架,通过(1)caption分解来分别处理空间和时间信息、(2)基于最佳视图过滤的时序帧选择以获取充分的时间信息、(3)参考驱动的理解以捕获细粒度运动和动态上下文以及(4)精选的视觉/文本提示技术来增强VLM性能。在WTS \cite{kong2024wts}和BDD \cite{BDD}数据集上的实验结果表明,本框架在语义丰富性和交通场景解释方面实现了显著提升。我们的框架通过在AI City Challenge 2025 Track 2中的55.655的合理测试分数得到验证,显示其在资源高效且准确的交通分析中有效推进了实际应用。
引用
@article{arxiv.2508.13470,
title = {STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models},
author = {Tinh-Anh Nguyen-Nhu and Triet Dao Hoang Minh and Dat To-Thanh and Phuc Le-Gia and Tuan Vo-Lan and Tien-Huy Nguyen},
journal= {arXiv preprint arXiv:2508.13470},
year = {2025}
}
备注
ICCV Workshop 2025