利用生成式语言模型进行视频-语言联合学习中的弱监督句子成分分析
计算机视觉与模式识别
2023-12-13 v1 机器学习
摘要
对文本数据的透彻理解是多模态视频分析任务的基本要素。然而,近期研究表明,当前模型在面向目标下游任务的训练过程中,并未实现对文本数据的全面理解。与此前针对这一局限性的方法不同,我们假设根据目标任务理解句子成分的重要性可能会提升模型性能。因此,我们利用预训练大语言模型(LLM)的知识,针对特定句子成分从原始文本生成文本样本。我们提出了一个弱监督重要性估计模块,用于计算各成分的相对重要性,并利用它们来改进不同的视频-语言任务。通过严格的定量分析,我们提出的方法在多个视频-语言任务上均表现出显著提升。特别是,在视频-文本检索任务中,我们的方法在R@1指标上,视频到文本检索相较于基线相对提升8.3%,文本到视频检索相对提升1.4%。此外,在视频时刻检索任务中,不同基线下的平均mAP相对提升幅度从2.0%到13.7%不等。
引用
@article{arxiv.2312.06699,
title = {Leveraging Generative Language Models for Weakly Supervised Sentence Component Analysis in Video-Language Joint Learning},
author = {Zaber Ibn Abdul Hakim and Najibul Haque Sarker and Rahul Pratap Singh and Bishmoy Paul and Ali Dabouei and Min Xu},
journal= {arXiv preprint arXiv:2312.06699},
year = {2023}
}