PolySmart @ TRECVid 2024 视频字幕生成(VTT)
计算机视觉与模式识别
2025-01-28 v3 多媒体
摘要
在本文中,我们介绍了我们在 TRECVid 2024 视频转文本(VTT)任务中的方法和结果,探索了 LLaVA 和 LLaVA-NeXT-Video 等视觉语言模型(VLM)在为视频内容生成自然语言描述方面的能力。我们研究了在 VTT 数据集上微调 VLM 的影响,以提高描述的准确性、上下文相关性和语言一致性。我们的分析表明,微调显著提高了模型生成更详细且与领域对齐的文本的能力,弥合了通用 VLM 任务与 VTT 专业需求之间的差距。实验结果表明,我们的微调模型在各种评估指标上均优于基线 VLM,凸显了针对复杂 VTT 任务进行领域特定调优的重要性。
引用
@article{arxiv.2412.15509,
title = {PolySmart @ TRECVid 2024 Video Captioning (VTT)},
author = {Jiaxin Wu and Wengyu Zhang and Xiao-Yong Wei and Qing Li},
journal= {arXiv preprint arXiv:2412.15509},
year = {2025}
}