PTVD:基于电视剧的面向情节大规模多模态数据集
计算机视觉与模式识别
2023-06-27 v1 信息检索
摘要
电影和电视(TV)剧等艺术形式是对现实世界的反映,近来已引起多模态学习界的广泛关注。然而,该领域现有语料库存在三个局限:(1)以场景为导向进行标注,忽略了情节内部的一致性;(2)其文本缺乏共情且很少提及情境上下文;(3)其视频片段因时长较短而无法覆盖长程关系。为解决这些基本问题,我们利用 1,106 集电视剧集与 24,875 句由专业人员撰写的聚焦情节的信息性句子,在 449 名人类标注者的协助下,构建了 PTVD——首个电视领域面向情节的多模态数据集。它也是此类首个非英语数据集。此外,PTVD 包含超过 2,600 万条弹幕评论(BSCs),可支撑大规模预训练。接下来,旨在为后续工作开源一个强基线,我们开发了以统一架构攻克不同影视建模问题的多模态算法。在三项受认知启发任务上的大量实验产生若干新颖发现(其中一些相当反直觉),进一步验证了 PTVD 在推动多模态研究方面的价值。数据集与代码发布于 \url{https://ptvd.github.io/}。
引用
@article{arxiv.2306.14644,
title = {PTVD: A Large-Scale Plot-Oriented Multimodal Dataset Based on Television Dramas},
author = {Chen Li and Xutan Peng and Teng Wang and Yixiao Ge and Mengyang Liu and Xuyuan Xu and Yexin Wang and Ying Shan},
journal= {arXiv preprint arXiv:2306.14644},
year = {2023}
}
备注
19 pages, 10 figures