人类反馈驱动的动态语音情感识别
声音
2025-08-22 v1 人机交互
机器学习
音频与语音处理
摘要
本工作提出探索动态语音情感识别的新领域。与传统方法不同,我们假设每条音轨与在不同时刻激活的情感序列相关联。该研究特别关注情感 3D 虚拟人的动画。我们提出了一种多阶段方法,包括训练经典语音情感识别模型、合成生成情感序列,以及基于人类反馈的进一步模型改进。此外,我们引入了一种基于 Dirichlet 分布的情感混合建模新方法。模型基于从 3D 面部动画数据集中提取的真实情感进行评估。我们将模型与滑动窗口方法进行了比较。实验结果表明,基于 Dirichlet 的方法在建模情感混合方面的有效性。结合人类反馈进一步提升了模型质量,同时简化了标注流程。
引用
@article{arxiv.2508.14920,
title = {Human Feedback Driven Dynamic Speech Emotion Recognition},
author = {Ilya Fedorov and Dmitry Korobchenko},
journal= {arXiv preprint arXiv:2508.14920},
year = {2025}
}