实时视频字幕
计算机视觉与模式识别
2025-05-27 v2
摘要
密集视频字幕涉及检测和描述视频序列中的事件。传统方法在离线环境下工作,假设整个视频都可用进行分析。相比之下,本文引入了一种开创性范式:实时视频字幕(Live Video Captioning, LVC),其中必须以在线方式生成视频流的字幕。这一转变带来了独特的挑战,包括处理部分观察事件和对动作的时序预感需求。我们正式定义了 LVC 的新问题,提出了专为该在线场景设计的新型评估指标,展示了它们相对于传统指标的优势。为解决 LVC 的新型复杂性,我们提出了一种新模型,将可变形变换器与时序滤波结合,实现对视频流的有效字幕生成。在 ActivityNet Captions 数据集上进行大量实验,验证了所提出方法在 LVC 场景下优于现有 SOTA 离线方法的性能。为促进进一步的研究,我们提供了我们的模型结果以及集成新指标的评估工具箱,地址为:https://github.com/gramuah/lvc。
引用
@article{arxiv.2406.14206,
title = {Live Video Captioning},
author = {Eduardo Blanco-Fernández and Carlos Gutiérrez-Álvarez and Nadia Nasri and Saturnino Maldonado-Bascón and Roberto J. López-Sastre},
journal= {arXiv preprint arXiv:2406.14206},
year = {2025}
}