EvalYaks:面向 CEFR B2 口语评估转录的指令调优数据集与 LoRA 精调模型
计算与语言
2025-06-02 v2 人工智能
摘要
依赖人类专家对 CEFR 口语评估进行评估在线教学环境中存在可扩展性挑战,限制了评估的速度和覆盖范围。我们旨在自动化来自对话转录的 CEFR B2 英语口语评估。首先,我们评估了领先的开源和商业大型语言模型 (LLM) 在全球和印度特定情境下,对候选人在 CEFR B2 口语考试中各项评估标准的评分能力。随后,我们构建了一个经专家验证、与 CEFR 对齐的合成对话数据集,包含不同评估得分的转录文本。此外,开发了新的指令调优数据集,源自英语词汇档案(最高至 CEFR B2 级别)和 CEFR-SP WikiAuto 数据集。最后,基于这些新数据集,对 Mistral Instruct 7B v0.2 进行参数高效指令调优,开发了称为 EvalYaks 的一系列模型。该系列模型中有四个用于评估 CEFR B2 口语考试的四个章节,一个用于识别 CEFR 词汇水平并生成对应水平的词汇,另一个用于检测文本的 CEFR 水平并生成对应水平的文本。EvalYaks 实现了 96% 的平均可接受准确率,变异系数为 0.35 个水平,且相较于下一最佳模型提升了约 3 倍。这表明,基于高质量 CEFR 对齐评估数据进行 7B 参数 LLM 的指令调优,能够有效评估和评分 CEFR B2 英语口语评估,为可扩展的自动语言水平评估提供了有前景的解决方案。
引用
@article{arxiv.2408.12226,
title = {EvalYaks: Instruction Tuning Datasets and LoRA Fine-tuned Models for Automated Scoring of CEFR B2 Speaking Assessment Transcripts},
author = {Nicy Scaria and Silvester John Joseph Kennedy and Thomas Latinovich and Deepak Subramani},
journal= {arXiv preprint arXiv:2408.12226},
year = {2025}
}