中文

SECap:基于大语言模型的语音情感描述生成

声音 2023-12-27 v3 音频与语音处理

摘要

语音情感在人类交流中至关重要,并被广泛应用于语音合成和自然语言理解等领域。以往的大多数研究(如语音情感识别)将语音情感划分为固定的类别集合。然而,人类语音中表达的情感通常是复杂的,将其归入预定义的类别可能不足以充分表示语音情感。相反,直接通过自然语言描述语音情感可能是一种更有效的方法。遗憾的是,目前关注这一方向的研究并不多。因此,本文提出了一种名为 SECap 的语音情感描述生成框架,旨在利用自然语言有效地描述语音情感。得益于大语言模型在语言理解和文本生成方面的出色能力,SECap 采用 LLaMA 作为文本解码器,以生成连贯的语音情感描述。此外,SECap 利用 HuBERT 作为音频编码器来提取通用语音特征,并利用 Q-Former 作为 Bridge-Net,为 LLaMA 提供与情感相关的语音特征。为此,Q-Former 利用互信息学习来解耦与情感相关的语音特征和语音内容,同时实施对比学习以提取更多与情感相关的语音特征。客观和主观评估结果表明:1) SECap 框架在所有客观评估中均优于 HTSAT-BART 基线;2) SECap 能够生成高质量的语音情感描述,在主观平均意见分测试中达到与人类标注者相当的性能。

关键词

引用

@article{arxiv.2312.10381,
  title  = {SECap: Speech Emotion Captioning with Large Language Model},
  author = {Yaoxun Xu and Hangting Chen and Jianwei Yu and Qiaochu Huang and Zhiyong Wu and Shixiong Zhang and Guangzhi Li and Yi Luo and Rongzhi Gu},
  journal= {arXiv preprint arXiv:2312.10381},
  year   = {2023}
}

备注

Accepted by AAAI 2024