基于语音-语言模型的少样本情感识别中的情境学习个性化方法
音频与语音处理
2025-09-11 v1
摘要
本文提出了一种针对语音情感识别(SER)的情境学习(ICL)个性化方法。由于情感表达因人而异,针对说话人的特定适应性对于提高SER性能至关重要。常规的SER方法通常使用目标说话人的情感语音进行个性化,但通常难以提前准备对应所有情感标签的语音。我们克服这一困难的思路是通过ICL对目标说话人提供的少量情感语音进行条件化,以获取说话人的特征。ICL是一种通过在大型语言模型(LLM)推理中对少量输入-输出示例进行条件化,以执行未见任务的方法。我们对扩展自LLM的语音-语言模型进行元训练,以学习如何通过ICL实现个性化SER。实验结果表明,我们新收集的SER数据集上的实验结果表明,所提方法优于常规方法。
引用
@article{arxiv.2509.08344,
title = {Few-shot Personalization via In-Context Learning for Speech Emotion Recognition based on Speech-Language Model},
author = {Mana Ihori and Taiga Yamane and Naotaka Kawata and Naoki Makishima and Tomohiro Tanaka and Satoshi Suzuki and Shota Orihashi and Ryo Masumura},
journal= {arXiv preprint arXiv:2509.08344},
year = {2025}
}
备注
Accepted by ASRU 2025