用于情感识别的多模态局部-全局排序融合
人机交互
2018-09-14 v1 计算机视觉与模式识别
机器学习
摘要
情感识别是人工智能与人类交流分析交叉领域的核心研究方向。由于人类通过语言、视觉和听觉模态的复杂特异性组合来表达情感,这是一项重大的技术挑战。与传统多模态融合技术不同,我们从直接的独立于人的视角和相对的依赖于人的视角两方面处理情感识别。直接的独立于人的视角遵循常规情感识别方法,即直接从观测到的多模态特征推断绝对情感标签。相对的依赖于人的视角以相对方式处理情感识别,通过比较部分视频片段来确定情绪强度是增强还是减弱。我们提出的模型通过将情感识别任务划分为三个更简单的子任务来整合这些直接预测与相对预测视角。第一个子任务涉及对视频两个短片段间相对情绪强度的多模态局部排序。第二个子任务利用局部排序通过贝叶斯排序算法推断全局相对情绪秩。第三个子任务结合来自观测多模态行为的直接预测与来自局部-全局排序的相对情绪秩,用于最终情感预测。我们的方法在音视觉情感识别基准上表现出优异性能,并优于其他多模态融合算法。
引用
@article{arxiv.1809.04931,
title = {Multimodal Local-Global Ranking Fusion for Emotion Recognition},
author = {Paul Pu Liang and Amir Zadeh and Louis-Philippe Morency},
journal= {arXiv preprint arXiv:1809.04931},
year = {2018}
}
备注
ACM International Conference on Multimodal Interaction (ICMI 2018)