基于半监督边界感知语言模型预训练的中文序列标注
计算与语言
2024-04-09 v1
摘要
中文序列标注任务严重依赖于准确的词边界划分。尽管当前的预训练语言模型(PLM)在这些任务上取得了显著进展,但它们很少在建模过程中显式地融入边界信息。BABERT 是个例外,它将无监督统计边界信息融入到了中文 BERT 的预训练目标中。在此方法的基础上,我们输入有监督的高质量边界信息以增强 BABERT 的学习,开发了一种半监督的边界感知 PLM。为了评估 PLM 编码边界的能力,我们引入了一种简单且有效的“边界信息度量”。该度量允许在不进行特定任务微调的情况下比较不同的 PLM。在中文序列标注数据集上的实验结果表明,改进的 BABERT 变体不仅在中文序列标注任务上优于原始版本,而且在更广泛的中文自然语言理解任务上也表现更佳。此外,我们提出的度量为评估 PLM 的边界感知提供了一种便捷且准确的手段。
引用
@article{arxiv.2404.05560,
title = {Chinese Sequence Labeling with Semi-Supervised Boundary-Aware Language Model Pre-training},
author = {Longhui Zhang and Dingkun Long and Meishan Zhang and Yanzhao Zhang and Pengjun Xie and Min Zhang},
journal= {arXiv preprint arXiv:2404.05560},
year = {2024}
}
备注
Accepted to COLING 2024