融合音频、文本与视觉特征的新闻视频情感分析
计算与语言
2016-04-12 v1
摘要
本文提出了一种基于从新闻视频内容中提取的音频、文本和视觉线索融合来执行新闻视频情感分析的新方法。该方法旨在为关于此媒体宇宙的ethos(身份)构建的半话语研究做出贡献,这已成为数百万人现代生活的核心部分。为实现这一目标,我们应用最先进的计算方法用于(1)基于面部表情的自动情感识别,(2)参与者语音中调制的提取,以及(3)从感兴趣视频相关的字幕中进行情感分析。更具体地,我们计算特征,例如:已识别情感视觉强度、参与者的景别、发声概率、声音响度、语音基频以及字幕中文本句子的情感得分(极性)。使用包含来自三个巴西和一个美国流行电视新闻节目的520个标注新闻视频的数据集进行的实验结果表明,我们的方法在情感(紧张程度)分类任务中实现了高达84%的准确率,从而展示了其在多种应用中被媒体分析师使用的巨大潜力,尤其是在新闻领域。
引用
@article{arxiv.1604.02612,
title = {Fusing Audio, Textual and Visual Features for Sentiment Analysis of News Videos},
author = {Moisés H. R. Pereira and Flávio L. C. Pádua and Adriano C. M. Pereira and Fabrício Benevenuto and Daniel H. Dalip},
journal= {arXiv preprint arXiv:1604.02612},
year = {2016}
}
备注
5 pages, 1 figure, International AAAI Conference on Web and Social Media