FullStop:基于 Transformer 的荷兰语标点与分词预测
计算与语言
2023-01-10 v1 人工智能
摘要
在将自动语音识别(ASR)应用于比利时荷兰语(Van Dyck 等人,2021)时,输出为由单词组成的无分段连续流,不含任何标点。下一步是进行分词并插入标点,使 ASR 输出更具可读性且易于人工校正。据我们所知,目前尚无在可用水平上运行的、公开可用的荷兰语标点插入系统。我们在此提出的模型是 Guhr 等人(2021)针对荷兰语模型的扩展,并已公开可用。我们基于荷兰语语言模型 RobBERT(Delobelle 等人,2020)训练了一个序列分类模型。对于输入序列中的每个单词,模型预测该单词后跟随的标点标记。我们还扩展了一个多语言模型,用于语言未知或存在语码转换的情况。在执行分词任务时,将最佳模型应用于域外测试数据,将 ASR 输出流的 200 个单词的滑动窗口送入分类器,当系统预测的分割标点符号比例高于阈值时即进行分词。结果表明其远优于机器翻译基线方法。
引用
@article{arxiv.2301.03319,
title = {FullStop:Punctuation and Segmentation Prediction for Dutch with Transformers},
author = {Vincent Vandeghinste and Oliver Guhr},
journal= {arXiv preprint arXiv:2301.03319},
year = {2023}
}
备注
18 pages