中文

面向古文中文实体识别的Logits约束RoBERTa框架

计算与语言 2025-05-07 v1

摘要

本文提出了一种用于古文中文实体识别的Logits约束(LC)框架,在EvaHan 2025基准上进行评估。我们的两阶段模型集成GujiRoBERTa进行语境编码,并采用可微分解码机制强制执行有效的BMES标签转换。实验表明,LC在高标签稀疏或大规模数据情境下均优于传统的CRF和BiLSTM方法。我们还提出了一种平衡标签复杂度与数据集大小的模型选择准则,为实际的古文中文NLP任务提供了实用指导。

关键词

引用

@article{arxiv.2505.02983,
  title  = {Logits-Constrained Framework with RoBERTa for Ancient Chinese NER},
  author = {Wenjie Hua and Shenghan Xu},
  journal= {arXiv preprint arXiv:2505.02983},
  year   = {2025}
}

备注

5 pages, 2 figures, 6 tables. Accepted to EvaHan 2025 shared task on Ancient Chinese NLP