VowelPrompt:通过元音级韵律增强实现文本语音情感识别
计算与语言
2026-02-09 v1
摘要
语音情感识别是一个复杂的多模态挑战,需要理解语言内容和声学表达,尤其是基频、强度和时间动态等韵律特征。虽然大型语言模型(LLM)在处理文本转录语料进行情感识别方面显示出前景,但它们通常忽略细粒度的韵律信息,限制了其效果和可解释性。本文提出 VowelPrompt,一个语言学导向的框架,通过可解释的、细粒度的元音级韵律线索增强 LLM 基于情感的识别。drawing on phonetic evidence that vowels serve as primary carriers of affective prosody(基于元音作为情感韵律主要载体的语音学证据),VowelPrompt 从时间对齐的元音片段中提取基频、能量和持续时间基_DESCRIPTOR,并将这些特征转换为自然语言描述以获得更好的可解释性。这种设计使 LLM 能够联合推理词汇语义和细粒度韵律变化。此外,我们采用由监督微调(SFT) followed by Reinforcement Learning with Verifiable Reward(RLVR)实现的两阶段适应程序,通过组相对策略优化(GRPO)增强推理能力、强制结构化输出一致性并提高跨域和说话人变化的泛化能力。广泛的评估显示,VowelPrompt 在零样本、微调、跨域和跨语言条件下一致优于最先进的情感识别方法,同时生成可解释的解释,这些解释在上下文语义和细粒度韵律结构中得到联合 grounding。
引用
@article{arxiv.2602.06270,
title = {VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation},
author = {Yancheng Wang and Osama Hanna and Ruiming Xie and Xianfeng Rui and Maohao Shen and Xuedong Zhang and Christian Fuegen and Jilong Wu and Debjyoti Paul and Arthur Guo and Zhihong Lei and Ozlem Kalinli and Qing He and Yingzhen Yang},
journal= {arXiv preprint arXiv:2602.06270},
year = {2026}
}
备注
Accepted to ICLR 2026