基于生理学洞察的声学时频表征学习用于语音情感识别
声音
2026-02-17 v1 人工智能
音频与语音处理
摘要
语音情感识别 (SER) 对人形机器人的社交互动和机器人心理诊断等任务至关重要,在此场景下可解释且高效的模型对安全性和性能至关重要。现有基于大规模数据集训练的深度模型大多不可解释,模型对情感声学信号的建模不足,无法捕捉和分析情感声音行为的核心生理学特征。生理学研究表明,声音振幅和相位的动力学与通过声道滤波器和声束源通过情感相关。然而,大多数现有深度模型仅涉及振幅,未能耦合振幅与相位之间的生理特征。本文提出PhysioSER,一种基于生理学的声学时频表征学习方法,以紧凑且即插即用的设计解决上述问题。PhysioSER构建振幅视图和相位视图,受声道解剖学和生理学 (VAP) 指导,辅助SSL模型进行SER。该VAP导向框架包含两个平行工作流程:一个声学特征表示分支用于基于VAP分解声学信号,将其嵌入四元数域,并使用 Hamilton 结构化四元数卷积来建模其动态相互作用;另一个基于冻结SSL backbone 的潜在表示分支。随后,对两者的 utterance 级别特征进行 Contrastive Projection and Alignment 对齐, followed by浅层注意力融合头进行SER分类。通过在14个数据集、10种语言和6种backbone上的大规模评估,表明PhysioSER在SER中具有可解释性和高效性,其实际效果通过在人形机器人平台上的实时部署得到验证。
引用
@article{arxiv.2602.13259,
title = {Learning Physiology-Informed Vocal Spectrotemporal Representations for Speech Emotion Recognition},
author = {Xu Zhang and Longbing Cao and Runze Yang and Zhangkai Wu},
journal= {arXiv preprint arXiv:2602.13259},
year = {2026}
}
备注
13 pages, 5 figures