中文

寻找相似习题的实证研究

人工智能 2021-11-18 v1

摘要

教育人工智能旨在赋能教育领域的任务,如智能组卷与巩固练习,其背后核心技术是如何匹配习题,即寻找相似习题(FSE)问题。现有多数方法强调其习题表示模型的性能,遗憾的是仍存在诸多挑战,如数据稀缺、对习题理解不足以及标签噪声高。我们发布了面向标签稀缺数据集的中文教育预训练语言模型 BERTEdu_{Edu},并引入习题规范化以克服习题中数学公式与术语的多样性。我们以创新方式基于解题思想发掘了新的辅助任务,并提出一种非常有效的 MoE 增强多任务模型用于 FSE 任务,以更好地理解习题。此外,利用置信学习对训练集进行剪枝,克服标注数据中的高噪声。实验表明,本文提出的这些方法非常有效。

关键词

引用

@article{arxiv.2111.08322,
  title  = {An Empirical Study of Finding Similar Exercises},
  author = {Tongwen Huang and Xihua Li},
  journal= {arXiv preprint arXiv:2111.08322},
  year   = {2021}
}

备注

35th Conference on Neural Information Processing Systems (NeurIPS 2021) Workshop on Math AI for Education(MATHAI4ED)