中文

呼叫中心对话中用于语音连续情感识别的声学与语言学表征

音频与语音处理 2023-10-10 v1 人工智能 计算与语言 机器学习

摘要

我们研究的目标是自动识别真实呼叫中心对话中的满意度与挫败感。本研究聚焦于一项工业应用,其中客户满意度被持续追踪以改善客户服务。为弥补大型标注情感数据库的不足,我们探索使用预训练语音表征作为面向 AlloSat 语料库的迁移学习形式。此外,若干研究指出情感不仅可从语音中检测,也可从面部特征、生物反应或文本信息中检测。在电话对话场景下,我们可利用语音信号及其转写将音频信息分解为声学与语言学两部分。我们的实验证实了使用预训练特征所带来的大幅性能提升。令人惊讶的是,我们发现语言学内容显然是预测满意度的主要贡献因素,且对未见过的数据泛化最佳。我们的实验得出使用 CamemBERT 表征具有明确优势的结论,然而声学与语言学模态融合的益处并不明显。在基于个体标注学习的模型中,我们发现融合方法对标注任务的主观性更具鲁棒性。本研究还探讨了性能可变性的问题,并试图从权重初始化、置信区间与标注主观性等不同视角估计该变异性。对语言学内容的深入分析探究了能够解释语言学模态在此任务中高贡献度的可解释因素。

关键词

引用

@article{arxiv.2310.04481,
  title  = {Acoustic and linguistic representations for speech continuous emotion recognition in call center conversations},
  author = {Manon Macary and Marie Tahon and Yannick Estève and Daniel Luzzati},
  journal= {arXiv preprint arXiv:2310.04481},
  year   = {2023}
}