NewsBench:评估大语言模型在中文新闻中编辑能力的系统评估框架
计算与语言
2024-06-05 v4 人工智能
摘要
我们提出了 NewsBench,这是一个新颖的评估框架,旨在系统评估大语言模型 (LLM) 在中文新闻领域的编辑能力。我们构建的基准数据集专注于写作能力的四个方面和安全合规的六个方面,包含手动精心设计的 1,267 个测试样本,涵盖多项选择题和简答题两种类型,涉及 24 个新闻领域的五项编辑任务。为了衡量性能,我们提出了基于 GPT-4 的不同自动评估协议,以评估 LLM 在简答题生成方面的写作能力和安全合规性,这两者均通过与人工评估的高度相关性得到了验证。基于该系统评估框架,我们对十种流行的支持中文的 LLM 进行了全面分析。实验结果突显了 GPT-4 和 ERNIE Bot 作为顶级表现者,但也揭示了在创意写作任务中新闻安全合规性的相对不足。我们的发现还强调了对机器生成的新闻内容加强伦理指导的必要性,标志着在使 LLM 与新闻标准和安全考量对齐方面迈出了重要一步。
引用
@article{arxiv.2403.00862,
title = {NewsBench: A Systematic Evaluation Framework for Assessing Editorial Capabilities of Large Language Models in Chinese Journalism},
author = {Miao Li and Ming-Bin Chen and Bo Tang and Shengbin Hou and Pengyu Wang and Haiying Deng and Zhiyu Li and Feiyu Xiong and Keming Mao and Peng Cheng and Yi Luo},
journal= {arXiv preprint arXiv:2403.00862},
year = {2024}
}
备注
Long paper, ACL 2024 Main