中文

从以模型为中心到以人为中心:修订距离作为基于 LLM 的应用中文本评估的指标

计算与语言 2024-04-12 v2 信息检索

摘要

评估大型语言模型(LLM)是基础性的工作,特别是在实际应用的背景下。传统的评估方法通常主要为 LLM 开发而设计,其产生的数值分数忽略了用户体验。因此,我们的研究在 AI 驱动的写作辅助应用背景下,将焦点从以模型为中心的评估转向以人为中心的评估。我们提出的指标称为“修订距离”,它利用 LLM 建议模仿人类写作过程的修订编辑。该指标通过计算 LLM 生成的修订编辑次数来确定。得益于生成的修订编辑细节,我们的指标能够以人类可理解的方式提供具有自我解释性的文本评估结果,超越了脱离上下文的分数。我们的结果表明,对于简单的写作任务,“修订距离”与既有指标(ROUGE、Bert-score 和 GPT-score)保持一致,但提供了更有见地的、详细的反馈,并能更好地区分文本。此外,在具有挑战性的学术写作任务背景下,我们的指标仍然可以提供可靠的评估,而其他指标往往难以应对。进一步而言,我们的指标在缺乏参考文本的场景中也具有巨大潜力。

关键词

引用

@article{arxiv.2404.07108,
  title  = {From Model-centered to Human-Centered: Revision Distance as a Metric for Text Evaluation in LLMs-based Applications},
  author = {Yongqiang Ma and Lizhi Qing and Jiawei Liu and Yangyang Kang and Yue Zhang and Wei Lu and Xiaozhong Liu and Qikai Cheng},
  journal= {arXiv preprint arXiv:2404.07108},
  year   = {2024}
}

备注

9 pages, 2 figures, under review