Eval-GCSC:评估 ChatGPT 中文拼写纠错性能的新指标
计算与语言
2023-11-15 v1 人工智能
摘要
ChatGPT 在各种下游任务中展现出令人印象深刻的性能。然而,在中文拼写纠错(CSC)任务中,我们观察到一种不一致:尽管 ChatGPT 在人工评估下表现良好,但按传统指标评分却很低。我们认为这种不一致源于传统指标并不适合评估生成式模型。它们过于严苛的长度与语音约束可能导致低估 ChatGPT 的纠错能力。为更好地评估生成式模型在 CSC 任务中的表现,本文提出一种新评估指标:Eval-GCSC。通过引入词级与语义相似度判断,它放宽了严苛的长度与语音约束。实验结果表明 Eval-GCSC 与人工评估高度一致。在该指标下,ChatGPT 的性能可与传统 token 级分类模型(TCM)相媲美,展现出其作为 CSC 工具的潜力。源代码与脚本可在 https://github.com/ktlKTL/Eval-GCSC 获取。
引用
@article{arxiv.2311.08219,
title = {Eval-GCSC: A New Metric for Evaluating ChatGPT's Performance in Chinese Spelling Correction},
author = {Kunting Li and Yong Hu and Shaolei Wang and Hanhan Ma and Liang He and Fandong Meng and Jie Zhou},
journal= {arXiv preprint arXiv:2311.08219},
year = {2023}
}