TrUMAn:电影与动画中的修辞手法理解
人工智能
2021-08-24 v3 计算机视觉与模式识别
摘要
理解视频内容对于搜索和推荐系统等许多实际应用至关重要。尽管深度学习的最新进展利用视觉线索提升了各种任务的性能,但推理意图、动机或因果关系的深度认知仍然具有挑战性。现有的旨在检验视频推理能力的数据集侧重于视觉信号(如动作、对象、关系),或者可以通过文本偏差来回答。鉴于此,我们提出了一项新任务以及一个新数据集:电影与动画中的修辞手法理解(TrUMAn),包含2423个视频,关联132种修辞手法,旨在评估和开发超越视觉信号的学习系统。修辞手法是创意作品中常用的叙事手段。通过应对修辞手法理解任务并赋予机器深度认知能力,数据挖掘应用和算法可以提升到新的水平。为应对具有挑战性的TrUMAn数据集,我们提出了一种修辞手法理解与故事讲述(TrUSt)方法,其中包含一个新的概念故事讲述器模块,该模块通过在潜在空间上进行视频故事讲述来引导视频编码器。实验结果表明,现有任务上的最先进学习系统在原始输入信号下仅达到12.01%的准确率。此外,即使在具有人工标注描述的理想情况下,BERT上下文嵌入也最多达到28%的准确率。我们提出的TrUSt将模型性能提升至13.94%。我们还提供了详细分析,为未来研究铺平道路。TrUMAn已公开:https://www.cmlab.csie.ntu.edu.tw/project/trope
引用
@article{arxiv.2108.04542,
title = {TrUMAn: Trope Understanding in Movies and Animations},
author = {Hung-Ting Su and Po-Wei Shen and Bing-Chen Tsai and Wen-Feng Cheng and Ke-Jyun Wang and Winston H. Hsu},
journal= {arXiv preprint arXiv:2108.04542},
year = {2021}
}
备注
CIKM 2021. The first two authors contributed equally to this work