Flesch 还是失手?评估指令微调语言模型对可读性标准的对齐
计算与语言
2023-11-07 v2
摘要
诸如 Flesch Kincaid 年级水平(FKGL)与欧洲共同语言参考框架(CEFR)等可读性指标与标准,旨在引导教师与教育者在课堂使用前妥善评估教材复杂度。本研究中,我们选取一组多样的开源与闭源指令微调语言模型,考察其在撰写故事补全与简化叙事——教师所执行的任务——中使用控制文本可读性的标准引导提示的表现。我们广泛的发现提供了经验证据:相较于 BLOOMZ 与 FlanT5 等展现出前景结果的其他开源模型,ChatGPT 等全球公认模型在这些生成任务上可能被认为效果较差,且可能需要更精细的提示。
引用
@article{arxiv.2309.05454,
title = {Flesch or Fumble? Evaluating Readability Standard Alignment of Instruction-Tuned Language Models},
author = {Joseph Marvin Imperial and Harish Tayyar Madabushi},
journal= {arXiv preprint arXiv:2309.05454},
year = {2023}
}
备注
Final camera-ready for EMNLP GEM Workshop 2023