中文

M2P2:基于自适应融合的多模态说服预测

计算机视觉与模式识别 2021-12-14 v2 计算与语言 机器学习 多媒体 声音 音频与语音处理

摘要

在对抗性环境中识别有说服力的演讲者是一项关键任务。在全国选举中,政客希望有说服力的演讲者代表他们进行竞选。当公司面临负面舆论时,他们希望在批评他们的对手面前聘请有说服力的代言人支持其立场。辩论代表了此类对抗性说服的常见平台。本文解决两个问题:辩论结果预测(DOP)问题预测谁赢得辩论,而说服强度预测(IPP)问题预测演讲者发言前后投票数的变化。尽管 DOP 此前已被研究,但我们首次研究 IPP。以往关于 DOP 的研究未能利用多模态数据的两个重要方面:1)多个模态通常在语义上对齐;2)不同模态可能为预测提供多样信息。我们的 M2P2(多模态说服预测)框架是首个使用多模态(声学、视觉、语言)数据解决 IPP 问题的方法。为利用不同模态的对齐性同时保持其提供线索的多样性,M2P2 设计了一种新颖的自适应融合学习框架,该框架融合来自两个模块的嵌入——一个从模态间提取共享信息的对齐模块,以及一个在三个分别训练的单模态参考模型指导下学习不同模态权重的异构模块。我们在为 DOP 设计的流行 IQ2US 数据集上测试 M2P2。我们还引入了一个名为 QPS(来自热门中国辩论电视节目《奇葩说》)的新数据集用于 IPP。M2P2 在两个数据集上均显著优于 4 种近期基线。

关键词

引用

@article{arxiv.2006.11405,
  title  = {M2P2: Multimodal Persuasion Prediction using Adaptive Fusion},
  author = {Chongyang Bai and Haipeng Chen and Srijan Kumar and Jure Leskovec and V. S. Subrahmanian},
  journal= {arXiv preprint arXiv:2006.11405},
  year   = {2021}
}

备注

published in IEEE Trans. on Multimedia 2021