视频摘要多粒度解释的集成框架
计算机视觉与模式识别
2024-05-17 v1 人工智能
摘要
本文提出一种用于视频摘要多粒度解释的集成框架。该框架集成了用于生成解释的方法,既可在片段层面(指示哪些视频片段对汇总器的决策影响最大)也可在更细粒度的视觉对象层面(突出显示哪些视觉对象对汇总器最具影响力)。为构建此框架,我们扩展了此领域的前期工作,通过研究基于模型不可知的扰动方法,用于视频摘要结果的片段层面解释,并引入一种新方法,将视频全景分割结果与扰动方法的解释方法相结合,以产生对象层面的解释。使用最先进的汇总方法和用于基准测试视频汇总的两个数据集评估所开发框架的性能。定性和定量评估结果表明,我们的框架能够识别视频中最具和最不具影响力的片段和视觉对象,并为汇总过程的输出提供一套全面的基于视觉的解释。
引用
@article{arxiv.2405.10082,
title = {An Integrated Framework for Multi-Granular Explanation of Video Summarization},
author = {Konstantinos Tsigos and Evlampios Apostolidis and Vasileios Mezaris},
journal= {arXiv preprint arXiv:2405.10082},
year = {2024}
}
备注
Under review