仍在之间?评估与改进语音助理对第三方中断的鲁棒性
计算与语言
2026-04-21 v1 人工智能
声音
摘要
虽然最近的 spoken language models (SLMs) 在实际场景中已被积极部署,但缺乏区分第三方中断 (TPI) 与主要用户持续发言能力,导致其易受语境性失败影响。为弥合这一差距,我们引入 TPI-Train,一个包含 88K 个实例的数据集,采用演员感知的硬负样本以强化对中断处理的声学线索优先级,并构建 TPI-Bench,一个全面的评估框架,严格衡量中断处理策略和精确说话人识别在欺骗性情境中的表现。实验表明,我们的数据集设计缓解了语义捷径学习——这是一种关键陷阱,模型利用语义上下文而忽略区分说话人变更的声学信号。我们认为该工作为克服 SLMs 中的文本主导的单模态依赖,为更健壮的多方说话交互铺平了道路。该框架的代码已公开于 https://tpi-va.github.io
引用
@article{arxiv.2604.17358,
title = {Still Between Us? Evaluating and Improving Voice Assistant Robustness to Third-Party Interruptions},
author = {Dongwook Lee and Eunwoo Song and Che Hyun Lee and Heeseung Kim and Sungroh Yoon},
journal= {arXiv preprint arXiv:2604.17358},
year = {2026}
}
备注
ACL 2026 main conference