中文

非结构化文本中政治声明的分割与标注策略

计算与语言 2025-03-11 v1

摘要

对议会演讲和政党宣言的分析已成为政治文本计算研究不可或缺的领域。虽然演讲主要使用无监督方法进行分析,但 MARPOR 项目的参与者创建了一个包含按声明政治立场标签的大型宣言语料库。最近有研究表明,这些标签可以由神经模型预测;然而,当前的方法依赖于提供的声明边界,限制了域外适用性。在这项工作中,我们提出并测试了一系列统一的分割与标注框架——基于线性链 CRF、微调的 text-to-text 模型,以及上下文学习与受限解码的结合——可用于从原始文本数据中联合分割和分类声明。我们表明,我们的方法应用于政治宣言的原始文本时实现了有竞争力的准确率,然后通过将其应用于英国下议院的记录并追踪过去三十年四大政党的政治轨迹,展示了我们方法的研究潜力。

关键词

引用

@article{arxiv.2503.07179,
  title  = {Strategies for political-statement segmentation and labelling in unstructured text},
  author = {Dmitry Nikolaev and Sean Papay},
  journal= {arXiv preprint arXiv:2503.07179},
  year   = {2025}
}

备注

Accepted to NLP4DH 2025 @ NAACL 2025