中文

ParliaBench:用于LLM生成议会演讲的评估与基准框架

计算与语言 2025-11-12 v1 计算机与社会

摘要

议会演讲生成是大型语言模型面临的特定挑战,超越标准文本生成任务。与通用文本生成不同,议会演讲不仅需要语言质量,还需要政治真实性和意识形态一致性。当前的语言模型缺乏针对议会语境的专业训练,现有的评估方法侧重于标准NLP指标,而非政治真实性。为此,我们提出ParliaBench,一个用于议会演讲生成的基准测试。我们构建了来自英国议会的演讲数据集,以实现系统化的模型训练。我们引入一种评估框架,将计算方法与LLM作为评判家的评估相结合,用于衡量生成质量在三个维度上:语言质量、语义连贯性和政治真实性。我们提出两种新的基于嵌入的指标,政治意识形态对齐和党派对齐,用于量化意识形态定位。我们对五个大型语言模型进行微调,生成了2.8万篇演讲,并使用我们的框架进行评估,比较了基线模型和微调模型。结果表明,微调在大多数指标上均产生了统计显著的改进,而我们新提出的指标在政治维度上表现出强大的区分能力。

关键词

引用

@article{arxiv.2511.08247,
  title  = {ParliaBench: An Evaluation and Benchmarking Framework for LLM-Generated Parliamentary Speech},
  author = {Marios Koniaris and Argyro Tsipi and Panayiotis Tsanakas},
  journal= {arXiv preprint arXiv:2511.08247},
  year   = {2025}
}