利用词大写与标点恢复模型改进越南语语音命名实体识别
计算与语言
2020-10-02 v1
摘要
命名实体识别(NER)任务的研究已展现出卓越成果,在具有正确文本格式(如恰当标点和大写)的输入文本上达到人类水平。然而,在输入为语音的应用中并不具备此类条件,因为文本由语音识别系统(ASR)生成,且该系统不考虑文本格式。在本文中,我们(1)提出了首个面向 NER 任务的越南语语音数据集,以及(2)首个公开的越南语大规模单语预训练语言模型,其以绝对 F1 分数较最新研究提升 1.3% 的成绩实现了越南语 NER 任务的新 SOTA。最后,(3)我们提出了一种从语音进行 NER 任务的新流水线,通过引入文本大写与标点恢复模型(CaPu)克服文本格式问题。该模型以 ASR 系统输入文本并同时执行两项任务,生成恰当的文本格式以帮助提升 NER 性能。实验结果表明,CaPu 模型助力 F1 分数提升近 4%。
引用
@article{arxiv.2010.00198,
title = {Improving Vietnamese Named Entity Recognition from Speech Using Word Capitalization and Punctuation Recovery Models},
author = {Thai Binh Nguyen and Quang Minh Nguyen and Thi Thu Hien Nguyen and Quoc Truong Do and Chi Mai Luong},
journal= {arXiv preprint arXiv:2010.00198},
year = {2020}
}
备注
Accepted in Interspeech 2020