MEGA:用于电影视频分割的多模态对齐聚合与蒸馏
计算机视觉与模式识别
2023-08-23 v1
摘要
先前的研究探讨了将电影视频分割为场景和叙事幕的任务。然而,这些研究忽视了有效且高效处理长视频(>60分钟)所必需的多模态对齐与融合任务。本文中,我们引入多模态对齐聚合与蒸馏(MEGA)用于电影长视频分割。MEGA 通过利用多种媒体模态应对该挑战。该方法利用对齐位置编码对变长度和不同模态的输入进行粗对齐。为在保持时间同步的同时降低计算量,我们进一步引入一种使用时间对齐的增强瓶颈融合层。此外,MEGA 采用一种新颖的对比损失来跨模态同步和迁移标签,从而实现从视频镜头上的带标签概要句进行幕分割。我们的实验结果表明,MEGA 在 MovieNet 数据集上的场景分割(平均精度提升 +1.19%)和 TRIPOD 数据集上的幕分割(总一致率提升 +5.51%)上优于最先进方法。
引用
@article{arxiv.2308.11185,
title = {MEGA: Multimodal Alignment Aggregation and Distillation For Cinematic Video Segmentation},
author = {Najmeh Sadoughi and Xinyu Li and Avijit Vajpayee and David Fan and Bing Shuai and Hector Santos-Villalobos and Vimal Bhat and Rohith MV},
journal= {arXiv preprint arXiv:2308.11185},
year = {2023}
}
备注
ICCV 2023 accepted