中文

立法命名实体识别的 GELATO 数据集

计算与语言 2026-03-17 v1

摘要

本文介绍 GELATO(Government, Executive, Legislative, and Treaty Ontology),即美国第 118 届国会众议院和参议院的议案数据集,采用 novel 两种层次命名实体识别 ontology 为美国立法文本设计。我们对不同架构和规模的 transformer 模型(BERT、RoBERTa)在该数据集上进行 fine-tuning,以完成第一层预测。随后,我们使用优化提示词的 LLMs 来完成第二层预测。RoBERTa 的强性能以及 BERT 模型的相对较弱性能,以及 LLMs 作为第二层预测器的应用,支持未来在立法命名实体识别或使用这些模型组合作为提取工具的下游任务的研究。

关键词

引用

@article{arxiv.2603.14130,
  title  = {The GELATO Dataset for Legislative NER},
  author = {Matthew Flynn and Timothy Obiso and Sam Newman},
  journal= {arXiv preprint arXiv:2603.14130},
  year   = {2026}
}

备注

Accepted at LREC 2026