中文

ChatGPT-EDSS:基于 ChatGPT 派生上下文词嵌入训练的共情对话语音合成

声音 2023-05-24 v1 计算与语言 机器学习 音频与语音处理

摘要

我们提出 ChatGPT-EDSS,一种利用 ChatGPT 提取对话上下文的共情对话语音合成(EDSS)方法。ChatGPT 是一个能深度理解输入提示的内容与目的并恰当回应用户请求的聊天机器人。我们关注 ChatGPT 的阅读理解能力,并将其引入 EDSS——一项合成能共情对话者情感的语音的任务。我们的方法首先将聊天记录交给 ChatGPT,让其针对聊天中每一行生成代表意图、情感和说话风格的三个词。然后,使用 ChatGPT 派生的上下文词的嵌入作为条件特征训练 EDSS 模型。实验结果表明,我们的方法与使用情感标签或从聊天记录中学习得到的神经网络派生上下文嵌入的方法性能相当。所收集的 ChatGPT 派生上下文信息可在 https://sarulab-speech.github.io/demo_ChatGPT_EDSS/ 获取。

关键词

引用

@article{arxiv.2305.13724,
  title  = {ChatGPT-EDSS: Empathetic Dialogue Speech Synthesis Trained from ChatGPT-derived Context Word Embeddings},
  author = {Yuki Saito and Shinnosuke Takamichi and Eiji Iimori and Kentaro Tachibana and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2305.13724},
  year   = {2023}
}

备注

5 pages, accepted for INTERSPEECH 2023