从语音预测情感轮廓的聚类
音频与语音处理
2024-06-06 v1 人机交互
摘要
连续情感识别(CER)旨在追踪一个人情绪状态随时间变化的动态过程。本文提出了一种新方法,将 CER 转化为从语音预测动态情感轮廓聚类的问题,其中情感轮廓被定义为在时间窗口内所标注情感属性的轮廓。我们的方法定义了一种称为聚类到预测(C2P)的框架,通过最小化聚类损失和语音驱动的情感轮廓预测损失来学习情感轮廓聚类。我们的客观结果表明,语音驱动的聚类对 arousal 和 valence 两种情感属性都具有价值。在 RECOLA 数据集上进行的实验结果令人鼓舞,四分类语音驱动情感轮廓预测模型的 arousal 和 valence 分别达到了 0.84 和 0.75 的 F1 分数。
引用
@article{arxiv.2406.02569,
title = {Cluster-to-Predict Affect Contours from Speech},
author = {Gökhan Kuşçu and Engin Erzin},
journal= {arXiv preprint arXiv:2406.02569},
year = {2024}
}
备注
8 pages, 3 figures