教 BERT 等待:面向流式不流畅检测的准确率与延迟平衡
计算与语言
2022-05-03 v1
摘要
在现代交互式语音系统中,语音在被去除不流畅成分之前是增量消费并转写的。这一后处理步骤对于生成干净转写文本以及下游任务(如机器翻译)的高性能至关重要。然而,大多数当前最先进的 NLP 模型(如 Transformer)以非增量方式运行,可能导致不可接受的延迟。我们提出一个基于流式 BERT 的序列标注模型,结合新颖的训练目标,能够实时检测不流畅并平衡准确率与延迟。这是通过训练模型决定是立即对当前输入输出预测还是等待更多上下文来实现的。本质上,模型学习动态调整其前瞻窗口大小。我们的结果表明,我们的模型产生可比较准确的预测,并且比基线更早做出预测,且闪烁更低。此外,相较于近期增量不流畅检测的工作,该模型达到了最先进的延迟与稳定性分数。
引用
@article{arxiv.2205.00620,
title = {Teaching BERT to Wait: Balancing Accuracy and Latency for Streaming Disfluency Detection},
author = {Angelica Chen and Vicky Zayats and Daniel D. Walker and Dirk Padfield},
journal= {arXiv preprint arXiv:2205.00620},
year = {2022}
}
备注
To be published at NAACL 2022