CleanS2S:面向主动语音到语音交互的单文件框架
人工智能
2025-06-03 v1 机器学习
摘要
CleanS2S 是一个用于类人语音到语音交互的框架,它通过单文件实现和主动对话能力推进了对话式 AI。我们的系统将自动语音识别、大语言模型和文本到语音合成集成到一个统一的流水线中,具备实时中断处理功能,通过全双工 websocket 连接和非阻塞 I/O 实现了低转换延迟。超越传统的聊天机器人范式,我们开创了主动交互机制,该机制将记忆系统与主观动作判断模块相结合,实现了五种类人响应策略:中断、拒绝、转移、沉默和标准响应。记忆模块动态聚合历史和上下文数据,为交互决策提供信息。这种方法允许系统发起的对话控制和上下文感知的响应选择,打破了僵化的基于轮次的惯例。我们提出了 Action Judgement SFT,用于评估输入流以制定响应策略。该框架具有原子配置的单文件实现,为研究人员提供了交互智能体前所未有的透明度和可扩展性。CleanS2S 的代码发布在 \https://github.com/opendilab/CleanS2S。
引用
@article{arxiv.2506.01268,
title = {CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction},
author = {Yudong Lu and Yazhe Niu and Shuai Hu and Haolin Wang},
journal= {arXiv preprint arXiv:2506.01268},
year = {2025}
}