面向社交智能问答的面对面对比学习
机器学习
2022-10-28 v3 人工智能
计算机视觉与模式识别
摘要
创造人工社交智能——能够理解多人交互细微差别的算法——是处理多模态视频中面部表情与手势的一个令人振奋的新兴挑战。近期的多模态方法在许多任务上确立了最先进水平,但在建模社交交互中跨说话轮次的复杂面对面对话动态方面存在困难,尤其是在自监督设定下。本文提出面对面对比学习(F2F-CL),一种图神经网络,旨在利用分解节点沿说话轮次边界对多模态面对面交互进行语境化以建模社交交互。借助 F2F-CL 模型,我们提出在同一视频内对不同说话轮次的分解节点执行对比学习。我们在具有挑战性的 Social-IQ 数据集上进行了实验评估,并展示了最先进的结果。
引用
@article{arxiv.2208.01036,
title = {Face-to-Face Contrastive Learning for Social Intelligence Question-Answering},
author = {Alex Wilf and Martin Q. Ma and Paul Pu Liang and Amir Zadeh and Louis-Philippe Morency},
journal= {arXiv preprint arXiv:2208.01036},
year = {2022}
}