中文

三方多方语音活动投影用于口语对话系统的语气转换

计算与语言 2025-10-06 v2

摘要

语气转换是口语对话中的基本组成部分,但通常的研究大多涉及二方场景。本文聚焦于将语音活动投影(VAP)应用于预测三方多方场景下的未来语气转换。VAP模型的目标是仅利用声学数据预测每个说话者的未来语音活动。这项工作首次将VAP扩展到三方对话场景。我们在日本一个包含多种话题讨论的三方数据集上训练了多个模型。我们发现,所有模型的三方对话训练的VAP都优于基线模型,但话语类型的不同会影响准确率。这项研究表明,VAP可用于三方对话场景中的语气转换。未来的工作将将该三方VAP语气转换模型集成到口语对话系统中。

关键词

引用

@article{arxiv.2507.07518,
  title  = {Triadic Multi-party Voice Activity Projection for Turn-taking in Spoken Dialogue Systems},
  author = {Mikey Elmers and Koji Inoue and Divesh Lala and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2507.07518},
  year   = {2025}
}

备注

Proceedings of Interspeech 2025