人机交互中使用 Vision Transformers 的个性化语音情感识别
音频与语音处理
2025-03-18 v3 人机交互
机器人学
声音
摘要
情感是言语交流中的一个基本要素,因此在人机交互 (HRI) 中理解个体的情感状态变得至关重要。本文研究了视觉 Transformer 模型,即 ViT (Vision Transformers) 和 BEiT (BERT Pre-Training of Image Transformers) 流水线,在 HRI 中的语音情感识别 (SER) 应用。重点是通过在基准数据集上微调这些模型并利用集成方法,使 SER 模型能够泛化到个体语音特征。为此,我们收集了不同人类受试者与 NAO 机器人进行伪自然对话的音频数据。然后,我们微调了基于 ViT 和 BEiT 的模型,并在参与者的未见语音样本上测试了这些模型。结果表明,与微调原始 ViT 或 BEiT 相比,在基准数据集上微调视觉 Transformer,然后使用这些已微调的模型或集成 ViT/BEiT 模型,在从语音中识别四种主要情感(中性、快乐、悲伤和愤怒)时,获得了每个个体的最高分类准确率。
引用
@article{arxiv.2409.10687,
title = {Personalized Speech Emotion Recognition in Human-Robot Interaction using Vision Transformers},
author = {Ruchik Mishra and Andrew Frye and Madan Mohan Rayguru and Dan O. Popa},
journal= {arXiv preprint arXiv:2409.10687},
year = {2025}
}
备注
This work has been accepted for the IEEE Robotics and Automation Letters (RA-L)