OPOR-Bench:评估大型语言模型在线公众意见报告生成能力
计算与语言
2025-12-02 v1
摘要
在线公众意见报告汇聚新闻和社交媒体信息,为政府和企业提供时事危机管理。尽管大型语言模型已在自动化报告生成方面取得技术进展,但该特定领域的系统性研究仍显缺失,尤其缺乏正式的任务定义和相应的基准。为弥合这一差距,我们定义了自动化在线公众意见报告生成(OPOR-GEN)任务,并构建了 OPOR-BENCH 数据集,覆盖 463 个危机事件,包含对应的新闻文章、社交媒体帖子及参考摘要。为评估报告质量,我们提出了 OPOR-EVAL,一种新颖的基于智能体的框架,通过分析生成的报告来模拟人类专家评估。实验表明,该框架与人类判断高度相关。我们的完整任务定义、基准数据集和评估框架为该关键领域的后续研究提供了坚实的基础。
引用
@article{arxiv.2512.01896,
title = {OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation},
author = {Jinzheng Yu and Yang Xu and Haozhen Li and Junqi Li and Yifan Feng and Ligu Zhu and Hao Shen and Lei Shi},
journal= {arXiv preprint arXiv:2512.01896},
year = {2025}
}
备注
27 pages, accepted by CMC-Computers, Materials & Continua, 2025