基于DeBERTa的二元词元级分类用于全类型多词表达识别:一种轻量级语言增强方法
计算与语言
2026-01-28 v1
摘要
我们提出了一种用于多词表达(MWE)识别的综合方法,该方法结合了二元词元级分类、语言特征集成和数据增强。我们的DeBERTa-v3-large模型在CoAM数据集上达到了69.8%的F1值,比该数据集上的最佳结果(Qwen-72B, 57.8% F1)高出12个百分点,同时使用的参数减少了165倍。我们通过以下方式实现了这一性能:(1) 将检测重新表述为二元词元级START/END/INSIDE分类,而不是基于跨度的预测;(2) 整合名词短语分块和依存关系特征,有助于识别不连续和名词类型的MWE;(3) 应用过采样来解决训练数据中严重的类别不平衡问题。我们在STREUSLE数据集上验证了该方法的泛化能力,达到了78.9%的F1值。这些结果表明,精心设计的较小模型可以在结构化自然语言处理任务上显著优于大语言模型,这对资源受限的部署具有重要意义。
引用
@article{arxiv.2601.19360,
title = {Binary Token-Level Classification with DeBERTa for All-Type MWE Identification: A Lightweight Approach with Linguistic Enhancement},
author = {Diego Rossini and Lonneke van der Plas},
journal= {arXiv preprint arXiv:2601.19360},
year = {2026}
}
备注
Accepted at Findings of EACL 2026