中文

面向情感识别与自适应人机交互的云端跨模态 Transformer

计算机视觉与模式识别 2026-01-22 v1 人工智能 人机交互 机器学习 声音 音频与语音处理

摘要

情感识别是下一代人机交互(HCI)的基本组成部分,使机器能够感知、理解和响应用户的情感状态。然而,现有系统往往依赖单一模态分析,如面部表情、语音语调或文本情感,导致鲁棒性差、在实际环境中泛化能力差。为此,本研究提出了云端跨模态 Transformer(CMT)框架,用于多模态情感识别和自适应人机交互。该模型集成视觉、听觉和文本信号,采用预训练编码器(Vision Transformer、Wav2Vec2 和 BERT),并采用跨模态注意力机制捕获异构特征之间的复杂关联。通过利用云计算基础设施进行分布式训练(Kubernetes 和 TensorFlow Serving),该系统实现了大规模用户交互的可扩展、低延迟情感识别。在 IEMOCAP、MELD 和 AffectNet 等基准数据集上的实验表明,CMT 实现了最先进的性能,F1 分数提升 3.0 个百分点,交叉熵损失降低 12.9 个百分点,优于强大的多模态基线。此外,云端部署评估显示平均响应延迟为 128 毫秒,较传统基于 Transformer 的融合系统降低 35 个百分点。这些结果确认,所提出的框架实现了高效、实时情感识别和自适应反馈,可用于智能客服、虚拟辅导系统和情感计算界面,标志着云原生情感计算和具备情感智能交互系统的重要进展。

关键词

引用

@article{arxiv.2601.14259,
  title  = {A Cloud-Based Cross-Modal Transformer for Emotion Recognition and Adaptive Human-Computer Interaction},
  author = {Ziwen Zhong and Zhitao Shu and Yue Zhao},
  journal= {arXiv preprint arXiv:2601.14259},
  year   = {2026}
}