通过时空事件图从视觉到语言:一种可解释的自监督方法
计算机视觉与模式识别
2025-07-08 v1 人工智能
计算与语言
摘要
用自然语言描述视频内容的任务通常被称为视频描述。与通常简短且广泛可用的传统视频描述不同,长篇段落式的自然语言描述非常稀缺。当前数据集的这一局限性源于昂贵的人工标注,以及从底层故事视角(作为时空互联事件的复杂系统)解释语言形成过程这一极具挑战性的任务。通过对近期发表的方法和可用数据集的深入分析,我们发现,除了枚举式简单描述形式的描述之外,专门致力于用复杂语言描述视频问题的公开资源普遍缺乏。此外,虽然最先进的方法通过视频与文本之间的直接端到端学习,在从视频生成较短描述的任务上取得了令人印象深刻的结果,但解释视觉与语言之间关系的问题仍然遥不可及。在这项工作中,我们提出了一种基于时空事件图的视觉与语言之间的共享表示,该表示可以通过可解释和分析的方式获得,以整合和连接多个视觉任务,从而生成最终的自然语言描述。此外,我们还展示了我们的自动化、可解释的视频描述生成过程如何作为一个全自动教师,在自监督神经分析系统内有效训练直接的端到端神经学生通路。我们通过使用标准评估指标、人工标注和最先进视觉语言模型集成的一致性验证,我们的可解释神经分析方法在从多个不同数据集收集的视频上生成了连贯、丰富且相关的文本描述。
引用
@article{arxiv.2507.04815,
title = {From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach},
author = {Mihai Masala and Marius Leordeanu},
journal= {arXiv preprint arXiv:2507.04815},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2501.08460