VideoSET: 通过文本进行视频摘要评估
计算机视觉与模式识别
2014-06-24 v1 计算与语言
信息检索
摘要
本文提出VideoSET,一种通过文本进行视频摘要评估的方法,可以评估视频摘要保留原始视频中语义信息的能力。我们观察到语义最容易用文字表达,因此开发了一种基于文本的评估方法。给定一个视频摘要,首先生成该视频摘要的文本表示,然后使用基于自然语言处理的度量来衡量其与人类撰写的真实文本摘要之间的语义距离。我们表明,我们的技术与人类判断的一致性高于基于像素的距离度量。我们还发布了一些公开可用视频数据集的文本注释和真实文本摘要,供计算机视觉社区使用。
引用
@article{arxiv.1406.5824,
title = {VideoSET: Video Summary Evaluation through Text},
author = {Serena Yeung and Alireza Fathi and Li Fei-Fei},
journal= {arXiv preprint arXiv:1406.5824},
year = {2014}
}