CGCE:面向通用与金融领域的中文生成式对话评测基准
计算与语言
2023-05-25 v1
摘要
以 ChatGPT 和 GPT-4 为代表的生成式对话模型,通过引入指令与人类反馈实现了自然语言生成(NLG)的显著性能提升,带来了范式变革。然而,对话模型缺乏标准化评测基准,尤其是中文及领域专用模型,阻碍了其评估与进展。为弥补这一缺口,我们推出中文生成式对话评测(CGCE)基准,聚焦于通用与金融领域。CGCE 基准涵盖多样化任务,包括通用领域 200 道题与金融领域 150 道特定专业问题。人工评分从准确性、连贯性、表达清晰度和完整性等维度进行评估。CGCE 基准为研究者提供了标准化框架,用以评估和比较中文生成式对话模型,推动 NLG 研究的发展。
引用
@article{arxiv.2305.14471,
title = {CGCE: A Chinese Generative Chat Evaluation Benchmark for General and Financial Domains},
author = {Xuanyu Zhang and Bingbing Li and Qing Yang},
journal= {arXiv preprint arXiv:2305.14471},
year = {2023}
}