中文

ParaS2S:面向副语言感知的语音到语音交互的基准测试与对齐

音频与语音处理 2026-03-09 v2 信号处理

摘要

语音到语音 (S2S) 模型在对话中展现出良好的能力,但其处理副语言感知线索 - 如情绪、语调和说话人属性 - 的能力尚未得到充分探索,且在内容和风格上的适当响应仍受关注。进一步受限于高质量且富有表现力的演示稀缺。为此,我们引入了新的强化学习 (RL) 框架用于副语言感知 S2S,称为 ParaS2S,该框架在波形层面直接评估和优化响应内容和说话风格。我们首先构建了 ParaS2SBench,一个基准测试,用于以富有表现力且具有挑战性的查询评估输入输出对在内容和说话风格方面的自然性。对于自动评判器,我们提出了 PolyTone 训练策略和多阶段框架,防止端到端音频 LLM 评判时的风格幻觉。我们的评判器与人类偏好高度相关且可扩展,使模型能够通过 RL 与未标记语音交互并学习。实验表明,现有的 S2S 模型未能对副语言感知属性作出恰当的响应,仅不过于基于管线的基线。我们的 RL 方法 (ParaS2SAlign) 在 ParaS2SBench 上相对于监督微调 (SFT) 实现了约 10% 的相对改进,超过了所有先前模型,同时所需的成对演示显著少于纯 SFT。我们的发现凸显了为语音到语音交互提供可扩展且准确的自动评估器的必要性。

关键词

引用

@article{arxiv.2511.08723,
  title  = {ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction},
  author = {Shu-wen Yang and Ming Tu and Andy T. Liu and Xinghua Qu and Hung-yi Lee and Lu Lu and Yuxuan Wang and Yonghui Wu},
  journal= {arXiv preprint arXiv:2511.08723},
  year   = {2026}
}

备注

To appear in ICLR 2026