中文

CLIP4Caption++:用于视频字幕的多 CLIP 方法

计算机视觉与模式识别 2021-10-15 v3 机器学习

摘要

本报告描述了我们在 VALUE Challenge 2021 字幕任务中的解决方案。我们的方案名为 CLIP4Caption++,构建于 X-Linear/X-Transformer 之上,后者是一种具有编码器-解码器架构的先进模型。我们在提出的 CLIP4Caption++ 上做了如下改进:我们采用先进的编码器-解码器模型架构 X-Transformer 作为主框架,并做了如下改进:1) 我们利用三个强预训练 CLIP 模型提取与文本相关的外观视觉特征。2) 我们采用 TSN 采样策略进行数据增强。3) 我们引入视频字幕信息以提供更丰富的语义信息。3) 我们引入字幕信息,其与视觉特征融合作为引导。4) 我们设计了词级和句级集成策略。我们提出的方法在 VATEX、YC2C 和 TVC 数据集上分别取得了 86.5、148.4、64.5 的 CIDEr 分数,显示了我们所提 CLIP4Caption++ 在所有三个数据集上的优越性能。

关键词

引用

@article{arxiv.2110.05204,
  title  = {CLIP4Caption ++: Multi-CLIP for Video Caption},
  author = {Mingkang Tang and Zhanyu Wang and Zhaoyang Zeng and Fengyun Rao and Dian Li},
  journal= {arXiv preprint arXiv:2110.05204},
  year   = {2021}
}

备注

4 pages, VALUE Challenge 2021 captioning task chamionship solution