中文

PolySmart @ TRECVid 2024 视频字幕生成(VTT)

计算机视觉与模式识别 2025-01-28 v3 多媒体

摘要

在本文中,我们介绍了我们在 TRECVid 2024 视频转文本(VTT)任务中的方法和结果,探索了 LLaVA 和 LLaVA-NeXT-Video 等视觉语言模型(VLM)在为视频内容生成自然语言描述方面的能力。我们研究了在 VTT 数据集上微调 VLM 的影响,以提高描述的准确性、上下文相关性和语言一致性。我们的分析表明,微调显著提高了模型生成更详细且与领域对齐的文本的能力,弥合了通用 VLM 任务与 VTT 专业需求之间的差距。实验结果表明,我们的微调模型在各种评估指标上均优于基线 VLM,凸显了针对复杂 VTT 任务进行领域特定调优的重要性。

关键词

引用

@article{arxiv.2412.15509,
  title  = {PolySmart @ TRECVid 2024 Video Captioning (VTT)},
  author = {Jiaxin Wu and Wengyu Zhang and Xiao-Yong Wei and Qing Li},
  journal= {arXiv preprint arXiv:2412.15509},
  year   = {2025}
}