面向土耳其语对话的合成 Turn-Taking 数据集 Syn-TurnTurk
计算与语言
2026-04-16 v1 人工智能
摘要
管理自然对话的时机是语音式聊天机器人面临的重大挑战。大多数当前系统通常依赖简单静默检测,这常常失败,因为人类语言模式涉及不规则的停顿。这会导致机器人插话用户,破坏对话流程。对于缺乏高质量数据集以进行 turn-taking 预测的语言(如土耳其语),这一问题更为严重。本文介绍 Syn-TurnTurk,一个为土耳其语对话生成的合成数据集,利用多种 Qwen 大型语言模型 (LLM) 仿真真实口头交流,包括重叠和战略性停顿。我们使用各种传统和深度学习架构评估了该数据集。结果显示,特别是 BI-LSTM 和 Ensemble (LR+RF) 方法,能够实现较高的准确率 (0.839) 和 AUC 分数 (0.910)。这些发现表明,我们的合成数据集能够对模型产生积极影响,使其能够理解语言线索,从而在土耳其语的人机交互中实现更自然的交流。
引用
@article{arxiv.2604.13620,
title = {Syn-TurnTurk: A Synthetic Dataset for Turn-Taking Prediction in Turkish Dialogues},
author = {Ahmet Tuğrul Bayrak and Mustafa Sertaç Türkel and Fatma Nur Korkmaz},
journal= {arXiv preprint arXiv:2604.13620},
year = {2026}
}
备注
Accepted for publication in IEEE ICASI 2026