MoEmo 视觉 Transformer:在三维姿态估计中融合交叉注意力与运动向量用于人机交互情感检测
计算机视觉与模式识别
2023-12-19 v1 机器人学
摘要
情感检测对人机交互(HRI)中的智能系统提出了挑战。用于情感检测的基础深度学习技术受限于信息受限的数据集或缺乏必要复杂性以学习输入数据元素间交互(例如人类情感在不同情境下的差异)的模型。在当前工作中,我们提出 1) MoEmo(从运动到情感),一种基于跨情境三维人体姿态估计、用于机器人系统中人类情感检测的交叉注意力视觉 Transformer(ViT),以及 2) 一个提供人体全身运动视频及基于人体姿态与环境情境的对应情感标签的数据集。与现有方法相比,我们的方法通过对提取的全身人体姿态/手势运动向量与环境情境特征图使用交叉注意力,有效利用了手势运动向量与环境情境之间的细微联系。我们实现了一个交叉注意力融合模型,将运动向量与环境情境组合为联合表示以推导情感估计。利用我们的自然运动数据库,我们训练 MoEmo 系统联合分析运动与情境,取得的情感检测性能优于当前最先进水平。
引用
@article{arxiv.2310.09757,
title = {MoEmo Vision Transformer: Integrating Cross-Attention and Movement Vectors in 3D Pose Estimation for HRI Emotion Detection},
author = {David C. Jeong and Tianma Shen and Hongji Liu and Raghav Kapoor and Casey Nguyen and Song Liu and Christopher A. Kitts},
journal= {arXiv preprint arXiv:2310.09757},
year = {2023}
}
备注
IEEE/RSJ International Conference on Intelligent Robots (IROS), Detroit, Michigan