中文

端到端自动人格预测中音频、视觉与文本融合方法研究

人工智能 2018-05-17 v2 机器学习 机器学习

摘要

我们提出一种三模态架构,从含音频、文本与视频数据不同通道的视频片段预测大五人格特质分数。各通道均采用堆叠卷积神经网络。通道在决策层融合,并通过拼接各自全连接层融合。结果表明多模态融合方法优于任一单模态通道,较最佳单模态(视频)提升 9.4%。全文反向传播亦优于模态线性组合,意味着可利用模态间复杂交互构建更优模型。此外,我们可观察各模态对各特质的预测相关性。所述模型可用于提升虚拟代理的情绪智能。

关键词

引用

@article{arxiv.1805.00705,
  title  = {Investigating Audio, Visual, and Text Fusion Methods for End-to-End Automatic Personality Prediction},
  author = {Onno Kampman and Elham J. Barezi and Dario Bertero and Pascale Fung},
  journal= {arXiv preprint arXiv:1805.00705},
  year   = {2018}
}

备注

Accepted at ACL2018 short paper