基于人类反馈的神经语音提取
声音
2025-08-06 v1 机器学习
音频与语音处理
摘要
我们提出了首个使用人类反馈进行迭代细化的神经目标语音提取(TSE)系统。我们的方法允许用户标记TSE输出的特定片段,生成编辑掩码。细化系统随后在保持未标记区域的同时改进标记区域。由于大规模人类标记错误数据集难以收集,我们使用各种自动化掩码函数生成合成数据集,并在每个数据集上训练模型。评估显示,使用基于噪声功率的掩码(以dBFS为单位)和概率阈值方法训练的模型表现最佳,与人类注释一致。在22名参与者的研究中,用户倾向于选择经过细化的输出而非基线TSE。我们的发现表明,人类在环中细化是改善神经语音提取性能的有前景的方法。
引用
@article{arxiv.2508.03041,
title = {Neural Speech Extraction with Human Feedback},
author = {Malek Itani and Ashton Graves and Sefik Emre Eskimez and Shyamnath Gollakota},
journal= {arXiv preprint arXiv:2508.03041},
year = {2025}
}
备注
Interspeech 2025