中文

大语言模型在语言教学与测评技术中的应用

计算与语言 2023-07-18 v1 机器学习

摘要

近期发布的大语言模型(LLM)如 PaLM 和 GPT-4 在大众媒体与公众意识中产生了空前影响,引发了对其能力与潜在用途的兴奋与担忧交织的情绪,并使此前未受如此多关注的自然语言处理研究得以显露。这些进展为教育技术带来了巨大前景,本文我们具体探讨将大语言模型纳入 AI 驱动的语言教学与测评系统的潜力。我们考虑了若干研究领域,并讨论了围绕语言学习者教育技术中生成式 AI 的风险与伦理考量。总体而言,我们发现更大的语言模型在文本生成上优于先前模型,开辟了此前不可行的的内容生成路径。对于文本生成,必须谨慎提示,且其输出在可用前可能需要重塑。对于自动评分与语法错误纠正——这些任务的进展通过知名基准检验——早期研究表明,根据标准评估指标,大语言模型自身并未超越最先进(SOTA)结果。对于评分,文献中已确立的语言特征似乎仍应被用于获得最佳性能;对于错误纠正,模型或可提供现有方法未能灵敏测量的替代反馈风格。在所有情况下,都需开展工作以实验性地将大语言模型纳入语言学习者的教育技术中,从而正确理解并报告其能力与局限,并确保可预见的风险如错误信息与有害偏见得到缓解。

关键词

引用

@article{arxiv.2307.08393,
  title  = {On the application of Large Language Models for language teaching and assessment technology},
  author = {Andrew Caines and Luca Benedetto and Shiva Taslimipoor and Christopher Davis and Yuan Gao and Oeistein Andersen and Zheng Yuan and Mark Elliott and Russell Moore and Christopher Bryant and Marek Rei and Helen Yannakoudakis and Andrew Mullooly and Diane Nicholls and Paula Buttery},
  journal= {arXiv preprint arXiv:2307.08393},
  year   = {2023}
}

备注

Accepted at the AIED2023 workshop: Empowering Education with LLMs - the Next-Gen Interface and Content Generation