中文

CleanS2S:面向主动语音到语音交互的单文件框架

人工智能 2025-06-03 v1 机器学习

摘要

CleanS2S 是一个用于类人语音到语音交互的框架,它通过单文件实现和主动对话能力推进了对话式 AI。我们的系统将自动语音识别、大语言模型和文本到语音合成集成到一个统一的流水线中,具备实时中断处理功能,通过全双工 websocket 连接和非阻塞 I/O 实现了低转换延迟。超越传统的聊天机器人范式,我们开创了主动交互机制,该机制将记忆系统与主观动作判断模块相结合,实现了五种类人响应策略:中断、拒绝、转移、沉默和标准响应。记忆模块动态聚合历史和上下文数据,为交互决策提供信息。这种方法允许系统发起的对话控制和上下文感知的响应选择,打破了僵化的基于轮次的惯例。我们提出了 Action Judgement SFT,用于评估输入流以制定响应策略。该框架具有原子配置的单文件实现,为研究人员提供了交互智能体前所未有的透明度和可扩展性。CleanS2S 的代码发布在 \https://github.com/opendilab/CleanS2S。

关键词

引用

@article{arxiv.2506.01268,
  title  = {CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction},
  author = {Yudong Lu and Yazhe Niu and Shuai Hu and Haolin Wang},
  journal= {arXiv preprint arXiv:2506.01268},
  year   = {2025}
}