三方多方语音活动投影用于口语对话系统的语气转换
计算与语言
2025-10-06 v2
摘要
语气转换是口语对话中的基本组成部分,但通常的研究大多涉及二方场景。本文聚焦于将语音活动投影(VAP)应用于预测三方多方场景下的未来语气转换。VAP模型的目标是仅利用声学数据预测每个说话者的未来语音活动。这项工作首次将VAP扩展到三方对话场景。我们在日本一个包含多种话题讨论的三方数据集上训练了多个模型。我们发现,所有模型的三方对话训练的VAP都优于基线模型,但话语类型的不同会影响准确率。这项研究表明,VAP可用于三方对话场景中的语气转换。未来的工作将将该三方VAP语气转换模型集成到口语对话系统中。
引用
@article{arxiv.2507.07518,
title = {Triadic Multi-party Voice Activity Projection for Turn-taking in Spoken Dialogue Systems},
author = {Mikey Elmers and Koji Inoue and Divesh Lala and Tatsuya Kawahara},
journal= {arXiv preprint arXiv:2507.07518},
year = {2025}
}
备注
Proceedings of Interspeech 2025