R2T:用于低资源序列标注的规则编码损失函数
计算与语言
2025-10-17 v1 机器学习
摘要
我们提出Rule-to-Tag(R2T)框架,一种将语言规则多层级系统直接集成到神经网络训练目标中的混合方法。R2T的新颖之处在于其自适应损失函数,其中包含正则化项,教会模型以原则性不确定性处理词汇表外(OOV)单词。我们将此工作定义为我们所称的原则学习(PrL)范式中的一个案例研究,其中模型以显式任务约束而非仅依赖标注示例进行训练。我们在托赫语(Zarma)词性(POS)标注任务上进行实验,结果显示仅使用无标签文本训练的R2T-BiLSTM模型达到98.2%的准确率,显著优于仅用300个标注句子微调的AfriBERTa基线。我们进一步表明,对于更复杂的任务如命名实体识别(NER),R2T可作为强大的预训练步骤;使用R2T预训练后仅需50个标注句子即可微调的模型,优于仅用300个标注句子训练的基线。
引用
@article{arxiv.2510.13854,
title = {R2T: Rule-Encoded Loss Functions for Low-Resource Sequence Tagging},
author = {Mamadou K. Keita and Christopher Homan and Sebastien Diarra},
journal= {arXiv preprint arXiv:2510.13854},
year = {2025}
}