中文

When2Speak:面向大语言模型的多方对话中时间参与与轮次决策的数据集

计算与语言 2026-05-08 v1 人工智能

摘要

大语言模型(LLM)在生成情境恰当的响应方面表现出色,但在多方对话情境中仍表现不足,因为何时发言与何时发言同样重要。在此类情境下,过度地在每一轮发言时都作出回应会导致过多的插话并损害对话连贯性。我们引入 When2Speak,一个面向学习干预时机的合成数据集和四阶段生成管线,用于群体互动中的干预时机学习。该数据集包含来自 16,000 场包含 2-6 位说话者的对话,涵盖多样化的对话风格、语气和参与者动态,显式建模 SPEAK 与 SILENT 决策,共计超过 215,000 个实例。我们的管线组合了真实世界 grounding、结构化数据增强、受控对话文本合成和微调就绪监督,完全开源以支持可重复性和适应特定领域对话规范。通过多个模型家族的实验表明,在 When2Speak 上进行的监督微调(SFT)显著优于零样本基线(例如,4B+ 参数模型的平均 Macro F1 提升 60%,最大提升 120%)。然而,SFT 训练的模型仍系统性地偏保守,几乎一半值得干预的时机被忽略,如通过未命中干预率(MIR)所见,其平均值为 0.50,即便在更大模型规模下亦如此。为解决这一局限,我们应用了带不对称奖励 shaping 的强化学习,该方法将 MIR 降低至 0.186-0.218,召回率从 0.479 提升至 0.78-0.81。我们的发现确立了时间参与是对话智能的独立可训练维度,合成数据可为 LLM 在多方互动中更自然、恰当地参与提供有效且可扩展的路径。

关键词

引用

@article{arxiv.2605.05626,
  title  = {When2Speak: A Dataset for Temporal Participation and Turn-Taking in Multi-Party Conversations for Large Language Models},
  author = {Vihaan Nama and Shreya Mendi and Zian Ye and Brinnae Bent},
  journal= {arXiv preprint arXiv:2605.05626},
  year   = {2026}
}

备注

Currently under review. Dataset can be found: https://huggingface.co/datasets/duke-trust-lab/When2Speak