UBiSS:用于视频双模态语义汇总的统一框架
计算机视觉与模式识别
2024-06-25 v1 人工智能
多媒体
摘要
随着视频数据的激增,包括视觉模态(VM)和文本模态(TM)汇总技术在不断受到关注。然而,单模态汇总不可避免地丢失了视频的丰富语义信息。本文聚焦于一种更为全面的视频汇总任务,即视频双模态语义汇总 (BiSSV)。具体而言,我们首次以 (视频, VM-汇总, TM-汇总) 三元组格式构建了一个大规模数据集 BIDS。不同于传统处理方法,我们的构建过程包含一种旨在保留长视频中最 salient 内容的 VM-汇总提取算法。基于 BIDS,我们提出了用于 BiSSV 任务的统一框架 UBiSS,该框架同时建模视频中的显著性信息并生成 TM-汇总和 VM-汇总。我们进一步通过基于列表排序的目标函数优化模型,以提升其捕获亮点部分的能力。最后,我们提出一种指标 ,用于对双模态汇总进行联合评估。实验表明,我们的统一框架优于多阶段汇总管线。代码和数据已提供于 https://github.com/MeiYutingg/UBiSS。
引用
@article{arxiv.2406.16301,
title = {UBiSS: A Unified Framework for Bimodal Semantic Summarization of Videos},
author = {Yuting Mei and Linli Yao and Qin Jin},
journal= {arXiv preprint arXiv:2406.16301},
year = {2024}
}
备注
Accepted by ACM International Conference on Multimedia Retrieval (ICMR'24)