中文

HQTN-SER:基于混合量子张量网络的语音情感识别

量子物理 2026-05-15 v1

摘要

语音情感识别(SER)在现实世界条件下仍然脆弱,因为情感线索微妙、依赖于说话者且容易受到录音变异性的干扰,而高性能深度模型通常依赖于大型且精心策划的训练集。量子机器学习提供了一种用紧凑模块引入非线性相关性建模的替代方法,但现有的量子SER研究仍然有限,且电路结构的影响尚未得到充分理解。本文提出了HQTN-SER,一个混合量子-经典框架,研究量子张量网络连接性如何在小量子比特设置下支持SER。HQTN-SER引入了(i)一个受MPS启发的量子张量网络模块,该模块强制结构化交互,以少量可训练参数对语音表示中的相关性进行建模;以及(ii)一种融合策略,将量子测量特征与学习到的经典潜在嵌入相结合,用于端到端情感分类。我们在统一的预处理和训练协议下,在三个公共基准(RAVDESS、SAVEE和MDER)上评估了HQTN-SER。所提出的模型在各数据集上取得了一致的性能,RAVDESS = 80.12%,SAVEE = 78.26%和MDER = 73.51%准确率,具有稳定的收敛性和低量子比特数,表明张量网络结构可以成为量子辅助SER的有效且硬件感知的设计选择。结果提供了可复现的基线,并阐明了结构化量子模块何时能为当今的情感计算增加价值。

关键词

引用

@article{arxiv.2605.14523,
  title  = {HQTN-SER: Speech Emotion Recognition with Hybrid Quantum Tensor Networks},
  author = {Mahad Mohtashim and Nouhaila Innan and Muhammad Shafique},
  journal= {arXiv preprint arXiv:2605.14523},
  year   = {2026}
}

备注

9 pages, 5 figures