中文

基于语音-语言模型的少样本情感识别中的情境学习个性化方法

音频与语音处理 2025-09-11 v1

摘要

本文提出了一种针对语音情感识别(SER)的情境学习(ICL)个性化方法。由于情感表达因人而异,针对说话人的特定适应性对于提高SER性能至关重要。常规的SER方法通常使用目标说话人的情感语音进行个性化,但通常难以提前准备对应所有情感标签的语音。我们克服这一困难的思路是通过ICL对目标说话人提供的少量情感语音进行条件化,以获取说话人的特征。ICL是一种通过在大型语言模型(LLM)推理中对少量输入-输出示例进行条件化,以执行未见任务的方法。我们对扩展自LLM的语音-语言模型进行元训练,以学习如何通过ICL实现个性化SER。实验结果表明,我们新收集的SER数据集上的实验结果表明,所提方法优于常规方法。

关键词

引用

@article{arxiv.2509.08344,
  title  = {Few-shot Personalization via In-Context Learning for Speech Emotion Recognition based on Speech-Language Model},
  author = {Mana Ihori and Taiga Yamane and Naotaka Kawata and Naoki Makishima and Tomohiro Tanaka and Satoshi Suzuki and Shota Orihashi and Ryo Masumura},
  journal= {arXiv preprint arXiv:2509.08344},
  year   = {2025}
}

备注

Accepted by ASRU 2025