说或保持沉默:面向多方对话的情境感知式轮流发言
人工智能
2026-03-13 v1 计算与语言
摘要
现有的语音AI助手将每一次检测到的停顿都视为发言的邀请。这在二人对话中可行,但在多方语境下,AI助手与多个说话者共同参与时,停顿频繁且充满歧义。在这种情况下,每个停顿都发言的助手会变得嘈杂而非有用。本文我们提出情境感知式轮流发言:在每一次检测到的停顿时,基于完整对话情境, our 方法决定助手应说话还是保持沉默。我们构建了超过12万份标注过的多方语料基准数据集。评估八个最新大语言模型发现,零样本提示下它们在情境感知式轮流发言方面始终表现不佳。我们随后提出一种基于推理痕迹的监督式微调方法,将平衡准确率提升至最高23个百分点。我们的发现表明,情境感知式轮流发言并非一种涌现能力;它必须被显式训练。
引用
@article{arxiv.2603.11409,
title = {Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue},
author = {Kratika Bhagtani and Mrinal Anand and Yu Chen Xu and Amit Kumar Singh Yadav},
journal= {arXiv preprint arXiv:2603.11409},
year = {2026}
}
备注
Submitted for review to Interspeech 2026