BLSP-Emo:面向具有同情力的大型语音语言模型
计算与语言
2024-06-07 v1 声音
音频与语音处理
摘要
GPT-4o 的近期发布展示了端到端多模态模型在低延迟以及理解和生成富有情感表达的语音方面的潜力。尽管开放研究社区对细节知之甚少,但很可能涉及大量精心挑选的数据和计算资源,这些数据和资源都难以获取。在本文中,我们提出 BLSP-Emo(Bootstrapped Language-Speech Pretraining with Emotion support),一种新颖的方法,用于开发能够理解语音中的语义和情感并生成具有同情力 responses 的端到端语音语言模型。BLSP-Emo 通过两个阶段利用现有的语音识别(ASR)和语音情感识别(SER)数据集进行预训练。第一个阶段侧重语义对齐,遵循最近在 ASR 数据上进行语音语言模型预训练的工作方法。第二个阶段在由 SER 数据构建的情感感知续写任务上,对预训练的语音语言模型进行情感对齐。我们的实验表明,BLSP-Emo 模型在理解语音和提供具有同情力的 response 方面表现出色,无论是指令跟随任务还是对话场景。
引用
@article{arxiv.2406.03872,
title = {BLSP-Emo: Towards Empathetic Large Speech-Language Models},
author = {Chen Wang and Minpeng Liao and Zhongqiang Huang and Junhong Wu and Chengqing Zong and Jiajun Zhang},
journal= {arXiv preprint arXiv:2406.03872},
year = {2024}
}