基于演化伪令牌的零样本视频描述生成
计算机视觉与模式识别
2022-07-29 v2
摘要
我们提出一种零样本视频描述生成方法,采用两个冻结网络:GPT-2 语言模型与 CLIP 图文匹配模型。匹配分数用于引导语言模型生成与视频帧子集具有较高平均匹配分数的句子。与零样本图像描述方法不同,我们的工作一次性考虑整个句子。这是通过在生成过程中从零优化部分提示、修改提示中所有其他令牌的表示,并迭代重复该过程以逐步提升生成句子的具体性与完备性来实现的。实验表明,生成的描述连贯且展现出广泛的真实世界知识。代码见:https://github.com/YoadTew/zero-shot-video-to-text
引用
@article{arxiv.2207.11100,
title = {Zero-Shot Video Captioning with Evolving Pseudo-Tokens},
author = {Yoad Tewel and Yoav Shalev and Roy Nadler and Idan Schwartz and Lior Wolf},
journal= {arXiv preprint arXiv:2207.11100},
year = {2022}
}
备注
preprint