ASPIRin:面向全双工语音语言模型的交互式强化学习动作空间投影
计算与语言
2026-04-14 v1 人工智能
声音
音频与语音处理
摘要
端到端的全双工语音语言模型(SLMs)需要精确的说话轮次控制以实现自然交互。然而,通过标准原始标记强化学习(RL)优化时序动态会损害语义质量,导致严重的生成性崩溃和重复。我们提出 ASPIRin,一个面向交互式优化的 RL 框架,显式地将何时说话与说什么分离。通过动作空间投影(Action Space Projection),ASPIRin 将文本词汇映射为粗粒度的二元状态(主动语音 vs. 静默)。采用基于规则的奖励进行 Group Relative Policy Optimization(GRPO),它平衡了用户中断和响应延迟。经验评估显示,ASPIRin 在说话轮次、背部回应和暂停处理方面均实现了交互式优化。关键在于, isolating timing from token selection 保留了语义连贯性,并将重复 n grams 的比例降低了 50%以上,有效消除了退化性重复。
引用
@article{arxiv.2604.10065,
title = {ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models},
author = {Chi-Yuan Hsiao and Ke-Han Lu and Yu-Kuan Fu and Guan-Ting Lin and Hsiao-Tsung Hung and Hung-yi Lee},
journal= {arXiv preprint arXiv:2604.10065},
year = {2026}
}