中文

用于真实世界语音情感识别的深度强化学习域适应

声音 2024-12-30 v3 机器学习 音频与语音处理

摘要

借助语音情感识别(SER),计算机能够理解并以情感智能的方式与人互动。然而,SER 在跨语料库和真实世界实时数据流场景下的性能仍有较大提升空间。现有 SER 方法的一个缺陷是无法将已有模型适应到新域。为应对该挑战,研究者开发了域适应技术,将模型学到的知识跨域迁移。尽管现有域适应技术已提升了跨域性能,但仍可改进以适配真实世界实时数据流情境,即模型在部署时可自我调优。本文提出一种基于深度强化学习的策略(RL-DA),可在与环境交互并持续收集反馈的同时,将预训练模型适应到真实世界实时数据流设置。RL-DA 在 SER 任务上进行了评估,包括跨语料库与跨语言域适应方案。评估结果显示,在实时数据流设置下,RL-DA 在跨语料库和跨语言场景中分别比基线策略高出 11% 和 14%。

关键词

引用

@article{arxiv.2207.12248,
  title  = {Domain Adapting Deep Reinforcement Learning for Real-world Speech Emotion Recognition},
  author = {Thejan Rajapakshe and Rajib Rana and Sara Khalifa and Bjorn W. Schuller},
  journal= {arXiv preprint arXiv:2207.12248},
  year   = {2024}
}