基于关键词细化的少数监督视频字幕生成
计算机视觉与模式识别
2024-11-07 v1
摘要
视频字幕生成对视频内容进行描述。现有方法始终需要大量字幕(例如 10 或 20 个)来训练模型,这成本较高。本文探索仅使用一个或极少数真实句子的可能性,提出一种名为少数监督视频字幕生成的新任务。具体而言,我们提出了少数监督视频字幕生成框架,包含词汇约束的伪标签生成模块和关键词细化的字幕生成模块。不同于自然语言处理中随机采样可能导致无效修改(即更改词语),前者模块通过预训练的 token 级分类器指导模型执行某些操作(例如复制、替换、插入和删除),然后通过预训练语言模型微调候选句子。同时,前者采用重复惩罚采样以鼓励模型生成简洁且重复率较低的伪标签句子,并选择与预训练视频-文本模型最相关的句子。此外,为保持伪标签句子与视频内容之间的语义一致性,我们开发了基于 Transformer 的关键词细化器,采用视频-关键词门控融合策略以突出显示更相关的词语。广泛的实验表明,所提方法在少数监督和完全监督情景下均表现出优势。代码实现已公开于 https://github.com/mlvccn/PKG_VidCap。
引用
@article{arxiv.2411.04059,
title = {Pseudo-labeling with Keyword Refining for Few-Supervised Video Captioning},
author = {Ping Li and Tao Wang and Xinkui Zhao and Xianghua Xu and Mingli Song},
journal= {arXiv preprint arXiv:2411.04059},
year = {2024}
}
备注
12 figures, Accepted in Pattern Recognition