中文

Flesch 还是失手?评估指令微调语言模型对可读性标准的对齐

计算与语言 2023-11-07 v2

摘要

诸如 Flesch Kincaid 年级水平(FKGL)与欧洲共同语言参考框架(CEFR)等可读性指标与标准,旨在引导教师与教育者在课堂使用前妥善评估教材复杂度。本研究中,我们选取一组多样的开源与闭源指令微调语言模型,考察其在撰写故事补全与简化叙事——教师所执行的任务——中使用控制文本可读性的标准引导提示的表现。我们广泛的发现提供了经验证据:相较于 BLOOMZ 与 FlanT5 等展现出前景结果的其他开源模型,ChatGPT 等全球公认模型在这些生成任务上可能被认为效果较差,且可能需要更精细的提示。

关键词

引用

@article{arxiv.2309.05454,
  title  = {Flesch or Fumble? Evaluating Readability Standard Alignment of Instruction-Tuned Language Models},
  author = {Joseph Marvin Imperial and Harish Tayyar Madabushi},
  journal= {arXiv preprint arXiv:2309.05454},
  year   = {2023}
}

备注

Final camera-ready for EMNLP GEM Workshop 2023