面向地方政府会议记录的自然语言处理:任务、数据集、指标与基准的焦点文章
计算与语言
2026-02-10 v1
摘要
地方政府会议记录是官方文件,以会议纪要或笔录的形式,记录了机构会议中提案、讨论和程序性行动的展开过程。这些文件虽然通常结构清晰,但往往内容密集、官僚化,且在不同城市之间高度异质,在语言、术语、结构和整体组织上表现出显著差异。这种异质性使得非专家难以解读,也给智能自动化系统的处理带来了挑战,限制了公共透明度和公民参与。为应对这些挑战,可以采用计算方法来构建和解释此类复杂文档。特别是,自然语言处理(NLP)提供了成熟的方法,可以增强政府记录的可访问性和可解释性。在这篇焦点文章中,我们回顾了支持地方政府会议文档结构化的基础NLP任务。具体来说,我们回顾了三个核心任务:文档分割、特定领域实体提取和自动文本摘要,这些任务对于浏览冗长的审议过程、识别政治行为者和个人信息,以及生成复杂决策过程的简洁表示至关重要。在回顾这些任务时,我们讨论了方法论、评估指标和公开可用资源,同时强调了领域特定的挑战,如数据稀缺、隐私约束和来源多样性。通过综合这些基础任务的现有工作,本文提供了一个结构化的概述,说明NLP如何增强地方政府会议记录的结构化和可访问性。
引用
@article{arxiv.2602.08162,
title = {NLP for Local Governance Meeting Records: A Focus Article on Tasks, Datasets, Metrics and Benchmark},
author = {Ricardo Campos and José Pedro Evans and José Miguel Isidro and Miguel Marques and Luís Filipe Cunha and Alípio Jorge and Sérgio Nunes and Nuno Guimarães},
journal= {arXiv preprint arXiv:2602.08162},
year = {2026}
}