中文

用于自动评分的日英句子翻译练习数据集

计算与语言 2024-03-07 v1

摘要

本文提出了自动评估句子翻译练习(STEs)的任务,这些练习已被用于第二语言学习的早期阶段。我们将该任务形式化为根据教育者预先指定的评分标准对学生的回答进行评分。随后,我们创建了一个包含 21 个问题的日英 STE 数据集,共计 3,498 条学生回答(平均每条问题 167 条)。回答数据收集自学生和众包工作者。利用该数据集,我们展示了包括微调 BERT 模型和具有少样本上下文学习的 GPT 模型在内的基线性能。实验结果表明,具有微调 BERT 的基线模型能够以约 90% 的 F1 值分类正确回答,但对错误回答的分类准确率仅为 80% 以下。此外,具有少样本学习的 GPT 模型显示出比微调 BERT 更差的结果,表明我们新提出的任务即使对于最先进的大型语言模型也是一个具有挑战性的问题。

关键词

引用

@article{arxiv.2403.03396,
  title  = {Japanese-English Sentence Translation Exercises Dataset for Automatic Grading},
  author = {Naoki Miura and Hiroaki Funayama and Seiya Kikuchi and Yuichiroh Matsubayashi and Yuya Iwase and Kentaro Inui},
  journal= {arXiv preprint arXiv:2403.03396},
  year   = {2024}
}

备注

9 pages