中文

基于深度上下文多臂_bandit 的自适应端点检测

音频与语音处理 2024-02-09 v1 机器学习

摘要

当前的端点检测(EP)解决方案在监督框架下学习,不允许模型融入反馈并在在线设定中改进。此外,利用代价高昂的网格搜索来寻找端点检测模型的最佳配置是一种常见做法。本文中,我们旨在通过提出一种高效方法,在在线设定中给定语句级音频特征选择最优端点检测配置,同时避免超参数网格搜索,从而为自适应端点检测提供解决方案。我们的方法不需要真值标签,仅利用来自奖励信号的在线学习而无需标注标签。具体而言,我们提出了一种基于深度上下文多臂_bandit 的方法,其将神经网络的表示能力与 Thompson 建模算法的动作探索行为相结合。我们将我们的方法与若干基线比较,并表明我们的深度 bandit 模型也成功减少了早期截断错误,同时保持低延迟。

关键词

引用

@article{arxiv.2303.13407,
  title  = {Adaptive Endpointing with Deep Contextual Multi-armed Bandits},
  author = {Do June Min and Andreas Stolcke and Anirudh Raju and Colin Vaz and Di He and Venkatesh Ravichandran and Viet Anh Trinh},
  journal= {arXiv preprint arXiv:2303.13407},
  year   = {2024}
}