叙事桥接:通过因果-时间叙事增强视频字幕生成
计算机视觉与模式识别
2025-02-18 v3 人机交互
摘要
现有视频字幕基准和模型缺乏因果-时间叙事,这是由因果和效果连接、随时间展开并由角色或代理驱动的事件序列。这一缺乏叙事限制了模型生成文本描述的能力,这些描述捕捉视频内容中固有的因果和时间动态。为解决这一问题,我们提出NarrativeBridge,包括:(1)使用大语言模型和few-shot提示生成的新型因果-时间叙事(CTN)字幕基准,显式编码视频描述中的因果-效应时间关系;以及(2)具有独立编码器用于捕捉因果和效应动态的原因-效果网络(CEN),有效实现具有因果-时间叙事的字幕生成和学习。大量实验表明,CEN在 articulating 视频内容的因果和时间方面显著优于最先进的模型:在MSVD-CTN和MSRVTT-CTN数据集上分别为17.88和17.44 CIDEr。跨数据集评估进一步展示了CEN的强大泛化能力。该框架理解和生成包含视频中复杂因果-时间叙事结构的细腻文本描述,解决了视频字幕中的关键局限。项目详情请访问https://narrativebridge.github.io/。
引用
@article{arxiv.2406.06499,
title = {NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative},
author = {Asmar Nadeem and Faegheh Sardari and Robert Dawes and Syed Sameed Husain and Adrian Hilton and Armin Mustafa},
journal= {arXiv preprint arXiv:2406.06499},
year = {2025}
}
备注
International Conference on Learning Representations (ICLR) 2025