StyleCap:基于语音与语言自监督学习模型的自动说话风格描述生成
计算与语言
2023-12-29 v2 机器学习
声音
音频与语音处理
摘要
我们提出 StyleCap,一种从语音中生成说话风格自然语言描述的方法。尽管大多数传统的副语言/非语言信息识别技术侧重于预定义标签的类别分类或强度估计,但它们无法以可解释的方式提供识别结果的推理。StyleCap 是迈向从语音端到端生成说话风格提示(即自动说话风格描述生成)的第一步。StyleCap 使用语音与自然语言描述配对数据进行训练。我们训练神经网络将语音表示向量转换为前缀向量,并输入基于大语言模型(LLM)的文本解码器。我们探索了适用于这一新任务的恰当文本解码器和语音特征表示。实验结果表明,我们的 StyleCap 利用更丰富的 LLM 作为文本解码器、语音自监督学习(SSL)特征以及句子改写增强,提升了所生成说话风格描述生成的准确性与多样性。由我们的 StyleCap 生成的说话风格描述样本已公开可用。
引用
@article{arxiv.2311.16509,
title = {StyleCap: Automatic Speaking-Style Captioning from Speech Based on Speech and Language Self-supervised Learning Models},
author = {Kazuki Yamauchi and Yusuke Ijima and Yuki Saito},
journal= {arXiv preprint arXiv:2311.16509},
year = {2023}
}
备注
Accepted for ICASSP2024