基于深度耦合视频与弹幕神经网络的视觉-文本情感分析
计算机视觉与模式识别
2018-11-20 v1 计算与语言
多媒体
摘要
面向视频的用户情感分析旨在从在线视频流中嵌入的多媒体内容自动识别观看者的总体情感状态。现有工作分为两类:1)基于视觉的方法,关注视觉内容并提取视频的特定特征集。然而,由于较大的类内方差,通常难以从低级视频像素学到映射到高级情感空间的映射函数。2)基于文本的方法,关注与视频相关的用户生成评论的调查。传统语言学方法学到的词表示通常缺乏情感信息,且全局评论一般反映观看者的高级理解而非瞬时情感。为解决这些局限,本文提出同时联合利用视频内容和用户生成文本进行情感分析。特别地,我们引入利用一种新型用户生成文本,即“弹幕”,其为漂浮在视频上的实时评论,包含传达观看者情感观点的丰富信息。为增强文本特征提取中词语的情感判别性,我们提出情感词嵌入(EWE)通过联合考虑语义与情感来学习文本表示。之后,我们提出一种具有深度耦合视频与弹幕神经网络(DCVDN)的新型视觉-文本情感分析模型,其中视觉与文本特征通过基于深度典型相关自编码器的多视图学习被同步提取并融合形成综合表示。通过在自爬取的真实世界视频-弹幕数据集上的大量实验,我们证明 DCVDN 显著优于最先进的基线方法。
引用
@article{arxiv.1811.07485,
title = {Visual-Texual Emotion Analysis with Deep Coupled Video and Danmu Neural Networks},
author = {Chenchen Li and Jialin Wang and Hongwei Wang and Miao Zhao and Wenjie Li and Xiaotie Deng},
journal= {arXiv preprint arXiv:1811.07485},
year = {2018}
}
备注
Draft, 25 pages