寻找相似习题的实证研究
人工智能
2021-11-18 v1
摘要
教育人工智能旨在赋能教育领域的任务,如智能组卷与巩固练习,其背后核心技术是如何匹配习题,即寻找相似习题(FSE)问题。现有多数方法强调其习题表示模型的性能,遗憾的是仍存在诸多挑战,如数据稀缺、对习题理解不足以及标签噪声高。我们发布了面向标签稀缺数据集的中文教育预训练语言模型 BERT,并引入习题规范化以克服习题中数学公式与术语的多样性。我们以创新方式基于解题思想发掘了新的辅助任务,并提出一种非常有效的 MoE 增强多任务模型用于 FSE 任务,以更好地理解习题。此外,利用置信学习对训练集进行剪枝,克服标注数据中的高噪声。实验表明,本文提出的这些方法非常有效。
引用
@article{arxiv.2111.08322,
title = {An Empirical Study of Finding Similar Exercises},
author = {Tongwen Huang and Xihua Li},
journal= {arXiv preprint arXiv:2111.08322},
year = {2021}
}
备注
35th Conference on Neural Information Processing Systems (NeurIPS 2021) Workshop on Math AI for Education(MATHAI4ED)