以鸡尾酒派对为思考模式:链路思维与强化学习用于目标说话人自动语音识别
声音
2026-02-02 v2 音频与语音处理
摘要
目标说话人自动语音识别(TS-ASR)旨在从多说话人混合语音中转录指定目标说话人的语音。在鸡尾酒场景中进行。近期大型音频语言模型(LALMs)的发展已为 TS-ASR 带来了一些新思路。然而,对于 TS-ASR 任务,LALMs 的架构仍存在显著的优化空间。虽然链路思维(CoT)和强化学习(RL)在某些语音任务中已证明有效,但 TS-ASR 需要模型深入理解语音信号、区分各种说话人并处理重叠语音,特别适合采用导向推理的方法。因此,我们提出一种新框架,将 CoT 和 RL 训练融入 TS-ASR,以提升性能。构建了 TS-ASR 的新型 CoT 数据集,先在常规数据上训练模型,再在 CoT 数据上进行微调,最后使用精选数据进行 RL 训练以增强模型的泛化推理能力。实验结果表明,CoT 和 RL 训练显著提升了 TS-ASR 性能,证明了针对 TS-ASR 任务所设计的 CoT 和 RL 训练方法的有效性。
引用
@article{arxiv.2509.15612,
title = {Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition},
author = {Yiru Zhang and Hang Su and Lichun Fan and Zhenbo Luo and Jian Luan},
journal= {arXiv preprint arXiv:2509.15612},
year = {2026}
}