连接视觉与语言:建模视频叙事中的因果性与时空性
计算机视觉与模式识别
2024-12-17 v1
摘要
视频字幕是多模态机器学习领域的关键任务,旨在为视频内容生成描述性且连贯的文本叙事。尽管大型视觉语言模型(LVLMs)已取得显著进展,但它们往往难以捕捉复杂视频序列中固有的因果与时空动态。为解决此限制,我们提出一种增强框架,将因果时空推理模块(CTRM)集成到最先进的LVLMs中。CTRM包含两个关键组件:因果动态编码器(CDE)和时空关系学习器(TRL),共同从视频帧中编码因果依赖关系和时空一致性。我们进一步设计了多阶段学习策略进行优化,结合大规模视频文本数据集的预训练、带因果标注数据的微调,以及对比式嵌入对齐,以提升嵌入一致性。在MSVD和MSR-VTT等标准基准测试上的实验结果表明,我们的方法在自动评估指标(CIDEr、BLEU-4、ROUGE-L)以及人类评估方面均优于现有方法,生成的字幕更流畅、更连贯、更相关,呈现更丰富的因果时空叙事。这些结果验证了我们方法在生成富有因果时空性质的字幕方面的有效性。
引用
@article{arxiv.2412.10720,
title = {Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives},
author = {Ji-jun Park and Soo-joon Choi},
journal= {arXiv preprint arXiv:2412.10720},
year = {2024}
}