面向实时对话AI的层次化会话结束检测模型与主说话人分割
机器学习
2026-03-17 v1 声音
摘要
我们提出了一种面向基于语音的对话AI的实时前端,通过结合主说话人分割与层次化会话结束(EOT)检测,实现双说话人场景中的自然轮次切换。为了在多说话人环境中稳健运行,该系统持续识别并追踪主用户,确保下游EOT决策不会受到背景对话的干扰。追踪到的活动片段被输入一个层次化、因果性的EOT模型,该模型通过独立分析主说话人和对话机器人的逐说话人语音特征来预测即时对话状态。同时,该模型通过概率预测来预测近未来状态(\,ms),这些预测考虑了对话伙伴的语音。任务特定的知识蒸馏将wav2vec~2.0表示(768维)压缩为紧凑的MFCC基学生模型(32维),以实现高效部署。该系统在多类帧级别F1上达到82%,在回channel检测上达到70.6%,在二元最终vs.其他任务上达到69.3%。在一个端到端轮次检测基准上,我们的模型达到87.7%的召回率,而Smart Turn~v3为58.9%,同时将中位检测延迟保持在36\,ms,而Smart Turn~v3为800--1300\,ms。尽管仅使用1.14M参数,所提出的模型匹配或超越了基于Transformer的基线,同时大幅降低了延迟和内存占用,适合边缘部署。
引用
@article{arxiv.2603.13379,
title = {A Hierarchical End-of-Turn Model with Primary Speaker Segmentation for Real-Time Conversational AI},
author = {Karim Helwani and Hoang Do and James Luan and Sriram Srinivasan},
journal= {arXiv preprint arXiv:2603.13379},
year = {2026}
}
备注
Accepted for presentation at the IEEE Conference on Artificial Intelligence