MMSum:一个用于视频多模态摘要与缩略图生成的数据集
计算机视觉与模式识别
2023-11-21 v2 多媒体
摘要
具有多模态输出的多模态摘要(MSMO)已成为一个有前景的研究方向。然而,现有公开MSMO数据集存在诸多局限,包括维护不足、数据不可获取、规模有限以及缺乏合理分类,带来了显著挑战。为应对这些挑战并为这一新方向提供全面的数据集,我们精心构建了\textbf{MMSum}数据集。我们的新数据集具有:(1)针对视频与文本内容的人工校验摘要,为多模态学习提供优越的人工指导与标签。(2)全面且细致安排的分类,涵盖17个主类与170个子类以封装多样的真实场景。(3)在所提数据集上进行的基准测试,以评估各类任务与方法,包括\textit{视频摘要}、\textit{文本摘要}与\textit{多模态摘要}。为倡导可及性与协作,我们将把\textbf{MMSum}数据集与数据收集工具作为完全开源资源发布,以促进透明并加速未来发展。我们的项目网站位于~\url{https://mmsum-dataset.github.io/}
引用
@article{arxiv.2306.04216,
title = {MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos},
author = {Jielin Qiu and Jiacheng Zhu and William Han and Aditesh Kumar and Karthik Mittal and Claire Jin and Zhengyuan Yang and Linjie Li and Jianfeng Wang and Ding Zhao and Bo Li and Lijuan Wang},
journal= {arXiv preprint arXiv:2306.04216},
year = {2023}
}
备注
Project website: https://mmsum-dataset.github.io/