时空信息是否能提升两个视频摘要基准测试的效果?
计算机视觉与模式识别
2024-10-07 v1 多媒体
摘要
视频摘要的一个重要方面是理解视频每个部分背后的时序背景,以把握哪些内容重要,哪些内容不重要。近年来,视频摘要模型已尝试建模时空关系以表示此信息。这些模型在重要基准数据集上取得了最新的相关得分。然而,尚未有人评估时空关系是否即使达到最新的效果所必需。活动识别领域的前期工作发现,模型偏向静态线索(如场景或物体),而忽视运动信息,从而产生偏差。本文探询类似的偏差是否影响视频摘要任务。为此,我们分析时序信息在现有基准数据集中的作用。首先,我们估计以时序不变模型为基准,看它们在基准数据集(TVSum 和 SumMe)上的排名如何。随后,我们扰乱视频的时序顺序,以检验现有最新的模型受时序扰动的影响。我们的发现之一是,时序不变模型在 TVSum 数据集上获得的相关得分与人类基准相当接近。我们还展示了现有模型不受时序扰动的影响。此外,通过某些扰动策略(如按固定时间段随机重组),可以实际提高模型的相关得分。基于这些结果,我们发现时空关系在视频摘要中扮演次要角色,并提出这些基准测试是否充分建模视频摘要任务本身值得重新审视。代码地址:https://github.com/AashGan/TemporalPerturbSum
引用
@article{arxiv.2410.03323,
title = {Does SpatioTemporal information benefit Two video summarization benchmarks?},
author = {Aashutosh Ganesh and Mirela Popa and Daan Odijk and Nava Tintarev},
journal= {arXiv preprint arXiv:2410.03323},
year = {2024}
}
备注
Accepted for presentation at AEQUITAS workshop, Co-located with ECAI 2024