面向越南语与汉语分词的跨度标注方法
计算与语言
2021-10-04 v1
摘要
本文中,我们提出一种跨度标注方法为越南语分词建模 n-gram 信息,即 SPAN SEG。我们使用相同架构的编码器,将跨度标注方法与条件随机场进行比较。由于越南语和汉语具有相似的语言现象,我们在越南语树库基准数据集和五个汉语基准数据集上评估了所提方法。实验结果表明,在均应用上下文预训练语言模型 XLM-RoBERTa 和预测词边界信息的情况下,所提 SpanSeg 方法在越南语树库基准上取得了比序列标注方法更高的性能,达到了 98.31% 的 SOTA F 值。此外,我们在 BERT 和 ZEN 预训练语言模型上对跨度标注方法进行了微调,用于汉语分词,其参数量更少、推理更快,且在五个汉语基准上取得了与先前 SOTA 方法(带词记忆网络的分词)相当或更高的 F 值。
引用
@article{arxiv.2110.00156,
title = {Span Labeling Approach for Vietnamese and Chinese Word Segmentation},
author = {Duc-Vu Nguyen and Linh-Bao Vo and Dang Van Thin and Ngan Luu-Thuy Nguyen},
journal= {arXiv preprint arXiv:2110.00156},
year = {2021}
}
备注
In Proceedings of the 18th Pacific Rim International Conference on Artificial Intelligence (PRICAI 2021)