中文

基于自动字幕生成的交通领域视频问答

计算机视觉与模式识别 2023-07-20 v1 人工智能

摘要

视频问答(VidQA)在智能交通监控与智能交通系统领域展现出促进高级机器推理能力的显著潜力。然而,以往研究很少关注将城市交通场景知识整合到 VidQA 系统中。在本工作中,我们提出一种称为基于自动字幕生成的交通领域视频问答(TRIVIA)的新方法,它作为一种弱监督技术,将交通领域知识注入大型视频-语言模型。来自 SUTD-TrafficQA 任务的实证结果表明,TRIVIA 取得了显著提升,使代表性视频-语言模型的准确率相比基线设置提高了 6.5 个百分点(19.88%)。这一开创性方法极有希望推动该领域的进展,激励研究人员与从业者充分释放新兴视频-语言模型在交通相关应用中的潜力。

关键词

引用

@article{arxiv.2307.09636,
  title  = {Traffic-Domain Video Question Answering with Automatic Captioning},
  author = {Ehsan Qasemi and Jonathan M. Francis and Alessandro Oltramari},
  journal= {arXiv preprint arXiv:2307.09636},
  year   = {2023}
}

备注

Accepted in ITSC2023