基于模态感知的视频场景检测中的镜头关联与比较
计算机视觉与模式识别
2024-12-24 v1 多媒体
摘要
视频场景检测涉及评估每个镜头及其周围环境是否属于同一场景。要实现这一点,需要精细地关联每个镜头及其相邻镜头之间的多模态线索,如视觉实体和地点模态,并比较每个镜头周围的语义变化。然而,大多数方法 treats 多模态语义 equally,不检查镜头两侧之间的情境差异,导致检测性能次优。本文提出了一种方法——模态感知镜头关联与比较方法(MASRC),使其能够根据视觉实体和地点模态的各自特征关联镜头,同时比较多镜头的相似性,以显式编码场景变化。具体而言,通过从实体语义中挖掘长期镜头关联,同时从地点语义中揭示短期镜头关联,我们可以学习统一场景内一致性强、跨场景区分性强的独特镜头特征。一旦获得这些独特镜头特征,我们进一步通过相似性卷积对目标镜头前后相邻镜头的关系进行编码,以辅助识别场景结束镜头。我们验证了MASRC中所提出组件的广泛适用性。大量实验结果表明,所提出的MASRC显著推进了视频场景检测。
引用
@article{arxiv.2412.17238,
title = {Modality-Aware Shot Relating and Comparing for Video Scene Detection},
author = {Jiawei Tan and Hongxing Wang and Kang Dang and Jiaxin Li and Zhilong Ou},
journal= {arXiv preprint arXiv:2412.17238},
year = {2024}
}