中文

Phoenix-VAD:面向全双工语音交互的流式语义端点检测

音频与语音处理 2025-11-05 v4 声音

摘要

口语对话模型已显著推进了智能人机交互,但缺乏面向语义端点检测的即插即用全双工预测模块,阻碍了无缝音频交互。在本文中,我们引入 Phoenix-VAD,一种基于大语言模型(LLM)的模型,实现流式语义端点检测。具体而言,Phoenix-VAD 利用大语言模型的语义理解能力,结合滑动窗口训练策略,实现可靠的语义端点检测,同时支持流式推理。在语义完整和不完整的语音场景中进行实验表明,Phoenix-VAD 取得优异且具竞争力的性能。此设计使全双工预测模块能够独立于对话模型进行优化,为下一代人机交互提供更可靠、更灵活的支持。

关键词

引用

@article{arxiv.2509.20410,
  title  = {Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction},
  author = {Weijie Wu and Wenhao Guan and Kaidi Wang and Peijie Chen and Zhuanling Zha and Junbo Li and Jun Fang and Lin Li and Qingyang Hong},
  journal= {arXiv preprint arXiv:2509.20410},
  year   = {2025}
}

备注

It requires internal PR approval