中文

基于 Transformer 网络从视频中进行反馈信号检测与认同度估计

计算机视觉与模式识别 2023-06-05 v1 人机交互

摘要

倾听者使用简短的插话(即所谓的反馈信号)来表示关注或表达同意。该行为的自动分析对于人类对话分析与交互式对话代理至关重要。当前基于视觉行为的反馈信号分析最优方法利用两类特征:基于身体姿态的特征与基于面部行为的特征。与此同时,Transformer 神经网络已被确立为融合不同数据源输入的有效手段,但尚未应用于反馈信号分析。本工作中,我们基于姿态与面部信息对用于自动反馈信号分析的多模态 Transformer 架构进行了全面评估。我们同时处理反馈信号的检测任务以及估计反馈信号中所表达认同度的任务。在 MultiMediate'22 反馈信号检测挑战赛的评估中,我们采用单层 Transformer 架构达到了 66.4% 的准确率,优于先前最优水平。采用两层 Transformer 架构,我们进一步在估计反馈信号中所表达认同量的任务上确立了新的最优水平(0.0604 MSE)。

关键词

引用

@article{arxiv.2306.01656,
  title  = {Backchannel Detection and Agreement Estimation from Video with Transformer Networks},
  author = {Ahmed Amer and Chirag Bhuvaneshwara and Gowtham K. Addluri and Mohammed M. Shaik and Vedant Bonde and Philipp Müller},
  journal= {arXiv preprint arXiv:2306.01656},
  year   = {2023}
}

备注

Accepted at IEEE IJCNN'23