面向整体语言-视频表征:语言模型增强的 MSR-Video to Text 数据集
多媒体
2024-06-21 v1 计算机视觉与模式识别
信息检索
摘要
更稳健和整体的语言-视频表征是推动视频理解前进的关键。尽管训练策略得到了改善,但语言-视频数据集的质量受到了 insufficient 注意。当前的简单文本描述以及对语言-视频任务的视觉唯一关注,导致在查询 significantly complex 的真实世界自然语言视频检索任务中表征能力受到限制。本文介绍了一种自动增强视频语言数据集的方法,使其在更精细的表征学习需求下具有更大的模态和上下文感知能力,从而有助于所有下游任务。我们的方法多层次视频描述捕获实体、动作、语音转录、审美和情感线索,为训练提供了来自文本侧到视频侧的详细且相关信息。我们还开发了一种类似智能体的策略,使用语言模型生成高质量、事实准确的文本描述,减少人工干预并实现可扩展性。通过使用 MSR-VTT 数据集和几种多模态检索模型评估该方法在改善语言-视频表征方面的有效性。
引用
@article{arxiv.2406.13809,
title = {Towards Holistic Language-video Representation: the language model-enhanced MSR-Video to Text Dataset},
author = {Yuchen Yang and Yingxuan Duan},
journal= {arXiv preprint arXiv:2406.13809},
year = {2024}
}