中文

整合双模态讽刺检测器的反馈损失用于讽刺语音合成

计算与语言 2025-08-19 v1

摘要

讽刺语音合成,即生成能有效传达讽刺意味的语音,对于增强娱乐和人机交互等应用中的自然交互至关重要。然而,由于讽刺特有的细微韵律以及带标注的讽刺语音数据有限,合成讽刺语音仍然是一个挑战。为了解决这些挑战,本研究引入了一种新方法,将来自双模态讽刺检测模型的反馈损失整合到 TTS 训练过程中,从而增强模型捕捉和传达讽刺的能力。此外,通过利用迁移学习,一个在朗读语音上预训练的语音合成模型经历了两阶段微调过程。首先,它在包含讽刺语音在内的多种语音风格数据集上进行微调。在第二阶段,模型使用专门针对讽刺语音的数据集进一步优化,以增强其生成具有讽刺意识的语音的能力。客观和主观评估表明,我们提出的方法提高了合成语音的质量、自然度和讽刺意识。

关键词

引用

@article{arxiv.2508.13028,
  title  = {Integrating Feedback Loss from Bi-modal Sarcasm Detector for Sarcastic Speech Synthesis},
  author = {Zhu Li and Yuqing Zhang and Xiyuan Gao and Devraj Raghuvanshi and Nagendra Kumar and Shekhar Nayak and Matt Coler},
  journal= {arXiv preprint arXiv:2508.13028},
  year   = {2025}
}

备注

Speech Synthesis Workshop 2025