中文

二元交互中基于语音到面部和肢体手势的多模态情感耦合

多媒体 2025-06-13 v1 机器学习 声音 音频与语音处理

摘要

人类情感表达通过协调的声音信号、面部表情和手势动作而产生。虽然语音-面部对齐已得到充分研究,但将情感表达丰富的语音与区域面部和手部动作联系起来的更广泛动力学对于深入理解真实交互中情感和行为线索如何传达仍然至关重要。进一步调节这种协调的是对话交换的结构,如顺序轮次切换,这为多模态同步创造了稳定的时间窗口,而同时说话通常表明高唤醒时刻,会破坏这种对齐并影响情感清晰度。理解这些动力学通过提高跨模态在人类交互和AI系统中的时序和同步准确性来增强实时情感检测。本研究使用IEMOCAP语料库中二元交互的区域特定运动捕捉来检验多模态情感耦合。语音特征包括低级韵律、MFCCs以及模型推导的唤醒度、效价和类别情感(快乐、悲伤、愤怒、中性),并与3D面部和手部标记位移对齐。表达活跃度通过逐帧位移幅度来量化,语音到手势预测将语音特征映射到面部和手部运动。不重叠的语音始终引发更高的活跃度,尤其是在下面部和嘴巴区域。悲伤在非重叠期间表现出更高的表达性,而愤怒在重叠期间抑制了手势。预测映射显示韵律和MFCCs在发音区域具有最高准确率,而唤醒度和效价具有较低且更具上下文敏感性的相关性。值得注意的是,手部-语音同步在低唤醒和重叠语音下得到增强,但对效价则不然。

关键词

引用

@article{arxiv.2506.10010,
  title  = {Multimodal Emotion Coupling via Speech-to-Facial and Bodily Gestures in Dyadic Interaction},
  author = {Von Ralph Dane Marquez Herbuela and Yukie Nagai},
  journal= {arXiv preprint arXiv:2506.10010},
  year   = {2025}
}