DSGram:面向大语言模型时代的语法纠错动态加权子指标
计算与语言
2025-06-24 v2 人工智能
摘要
评估语法纠错(GEC)模型的性能正变得越来越具挑战性,因为基于大型语言模型(LLM)的 GEC 系统常常产生的纠正结果与提供的金标准参考不一致。这会削弱传统基于参考的评估指标的可靠性。本研究提出一种新的 GEC 模型评估框架 DSGram,集成语义连贯性(Semantic Coherence)、编辑级别(Edit Level)和流畅性(Fluency),并利用动态加权机制。我们的框架采用分析层次过程(AHP)结合大型语言模型来确定各评估准则的相对重要性。此外,我们开发了一个包含人工标注和 LLM 模拟句子的数据集,用于验证我们的算法并调整更具成本效益的模型。实验结果表明,我们提出的方法提高了 GEC 模型评估的效果。
引用
@article{arxiv.2412.12832,
title = {DSGram: Dynamic Weighting Sub-Metrics for Grammatical Error Correction in the Era of Large Language Models},
author = {Jinxiang Xie and Yilin Li and Xunjian Yin and Xiaojun Wan},
journal= {arXiv preprint arXiv:2412.12832},
year = {2025}
}