结合知识融合与上下文标签解释改进低资源序列标注
计算与语言
2025-10-07 v4
摘要
在低资源、特定领域场景中,序列标注仍然是一项重大挑战,特别是对于像中文这样字符密集的语言。现有方法主要侧重于增强模型理解力和提高数据多样性以提升性能。然而,这些方法在特定领域上下文中仍然面临模型适用性不足和语义分布偏差的问题。为了克服这些局限性,我们提出了一种新颖的框架,将基于 LLM 的知识增强工作流与基于片段的丰富高效知识融合提取(KnowFREE)模型相结合。我们的工作流采用解释提示来生成对目标实体的精确上下文解释,有效缓解语义偏差并丰富模型的上下文理解。KnowFREE 模型进一步整合了扩展标签特征,能够在推理期间不依赖外部知识实现高效的嵌套实体提取。在多个中文特定领域序列标注数据集上的实验表明,我们的方法达到了 SOTA 性能,有效应对了低资源设置带来的挑战。
引用
@article{arxiv.2501.19093,
title = {Improving Low-Resource Sequence Labeling with Knowledge Fusion and Contextual Label Explanations},
author = {Peichao Lai and Jiaxin Gan and Feiyang Ye and Yilei Wang and Bin Cui},
journal= {arXiv preprint arXiv:2501.19093},
year = {2025}
}