基于多模态情感分析的喜剧视频高光时间戳检测模型
计算机视觉与模式识别
2021-06-02 v1 人工智能
计算与语言
摘要
如今,互联网上的视频十分盛行。对视频进行精确而深入的理解,对平台和研究者而言都是一个困难但有价值的问题。现有的视频理解模型在物体识别任务上表现良好,但目前仍无法理解喜剧视频中如高光幽默帧这类抽象且具上下文的特征。当前的工业工作也主要集中于基于物体外观的基础类别分类任务。针对抽象类别的特征检测方法仍属空白。一种包含视频帧、音频频谱和文本信息的数据结构为探索提供了新方向。多模态模型被提出以使这一深入视频理解任务成为可能。本文分析了视频抽象理解的困难,并提出了一种多模态结构以在该领域取得最先进性能。随后我们选取若干多模态视频理解基准,并应用最合适模型以寻找最佳性能。最后,我们评估了本文中模型与方法的整体亮点与不足,并指出进一步改进的可能方向。
引用
@article{arxiv.2106.00451,
title = {Highlight Timestamp Detection Model for Comedy Videos via Multimodal Sentiment Analysis},
author = {Fan Huang},
journal= {arXiv preprint arXiv:2106.00451},
year = {2021}
}