中文

信息密度对用户生成内容命名实体识别影响的机制与优化研究

计算与语言 2026-04-22 v1

摘要

在干净、高资源语料库上训练的命名实体识别(NER)模型,在部署于噪声、稀疏的用户生成内容(UGC)时(如社交媒体),会出现性能崩溃。先前的研究主要关注点状症状的 remedial 方法——采用定制化微调以解决诸如新词、别名漂移、非标准拼写、长尾实体和类别不平衡等问题。然而,这些改进常常难以泛化,因为它们忽略了UGC固有的结构稀疏性。本研究揭示,表层噪声症状共享一个统一的根本原因:信息密度(Information Density, ID)低。通过分层混杂控制抽样实验(具体控制实体稀有性和注释一致性),本文确定ID作为独立关键因素。我们引入注意力光谱分析(Attention Spectrum Analysis, ASA)来量化降低ID如何导致注意力钝化,从而损害NER性能。基于这些机制性洞见,我们提出了窗口感知优化模块(Window-Aware Optimization Module, WOM),一个由大语言模型驱动的、模型无关的框架。WOM识别信息稀疏区域并利用选择性翻译后向增强语义密度,而不改变模型架构。在标准UGC数据集(WNUT2017、Twitter-NER、WNUT2016)上部署于主流架构之上,WOM可实现最高4.5%的绝对F1分数提升,展现出鲁棒性并在WNUT2017上达到新的最先进(SOTA)结果。

关键词

引用

@article{arxiv.2604.18944,
  title  = {A Mechanism and Optimization Study on the Impact of Information Density on User-Generated Content Named Entity Recognition},
  author = {Jiang Xiaobo and Dinghong Lai and Song Qiu and Yadong Deng and Xinkai Zhan},
  journal= {arXiv preprint arXiv:2604.18944},
  year   = {2026}
}