中文

面向个性化语言学习的大语言模型增强练习检索

信息检索 2024-02-28 v1 人工智能 计算与语言 机器学习

摘要

我们研究在线语言学习情境下的零样本练习检索问题,使学习者能够通过自然语言明确请求个性化练习。使用从语言学习者收集的真实数据,我们观察到向量相似度方法难以很好地捕捉练习内容与学习者用于表达学习意愿的语言之间的关系。查询与内容之间的这种语义鸿沟极大地降低了在 MS MARCO 等大规模信息检索数据集上预训练的通用检索模型的有效性。我们利用大语言模型的生成能力来弥合这一鸿沟,通过基于学习者输入合成假设性练习,然后利用这些假设性练习来搜索相关练习。我们的方法称为 mHyER,克服了三个挑战:(1)缺乏用于训练的相关性标签,(2)不受限制的学习者输入内容,以及(3)输入与检索候选之间语义相似度低。mHyER 在基于众包数据和公开数据创建的两个新基准上优于多个强基线。

关键词

引用

@article{arxiv.2402.16877,
  title  = {Large Language Model Augmented Exercise Retrieval for Personalized Language Learning},
  author = {Austin Xu and Will Monroe and Klinton Bicknell},
  journal= {arXiv preprint arXiv:2402.16877},
  year   = {2024}
}

备注

Presented at Learning Analytics and Knowledge 2024. 11 pages, 4 figures, 5 tables