迈向零样本与可解释视频描述:基于时空事件图推理
计算机视觉与模式识别
2025-01-16 v1 人工智能
计算与语言
摘要
在当前的机器学习时代,Transformer已成为计算机视觉和自然语言处理等多个领域的事实标准方法。基于Transformer的解决方案是当前最先进的语言生成、图像和视频分类、分割、动作和物体识别等方法的核心。有趣的是,尽管这些最先进的方法在各自领域产生了令人印象深刻的结果,但理解视觉与语言之间关系的问题仍然超出我们的能力范围。在本工作中,我们提出了一种基于时空事件的视觉与语言共同基础,以可解释和程序化的方式连接基于学习的视觉和语言最先进模型,并为用自然语言描述视频这一长期存在的问题提供解决方案。我们验证了我们的算法方法能够在来自多个数据集的视频上生成连贯、丰富且相关的文本描述,使用了标准指标(如Bleu、ROUGE)和现代的LLM-as-a-Jury方法。
引用
@article{arxiv.2501.08460,
title = {Towards Zero-Shot & Explainable Video Description by Reasoning over Graphs of Events in Space and Time},
author = {Mihai Masala and Marius Leordeanu},
journal= {arXiv preprint arXiv:2501.08460},
year = {2025}
}