面向多媒体社交分析的数据集与基准
计算与语言
2020-06-16 v1 计算机视觉与模式识别
多媒体
摘要
我们提出了一个公开可用的新数据集,旨在通过在同一语境下提供视觉与语言数据来推进多模态学习。这是通过从一个社交媒体网站获取数据实现的,该网站的帖子包含多个配对的图片/视频与文本,以及包含图片/视频和/或文本的评论树。该数据集共包含 67.7 万条帖子、290 万张帖子图片、48.8 万条帖子视频、140 万张评论图片、460 万条评论视频以及 9690 万条评论,不同模态的数据可联合使用以提升图像描述、图像分类、下一帧预测、情感分析和语言建模等多种任务的性能。我们给出了数据集的广泛统计信息。最后,我们使用预训练模型与若干全连接网络对其中一项回归任务提供了基线性能分析。
引用
@article{arxiv.2006.08335,
title = {A Dataset and Benchmarks for Multimedia Social Analysis},
author = {Bofan Xue and David Chan and John Canny},
journal= {arXiv preprint arXiv:2006.08335},
year = {2020}
}
备注
Published as a workshop paper at "Multimodality Learning" (CVPR 2020)