Alloprof:一个新的法语问答教育数据集及其在信息检索案例研究中的使用
计算与语言
2023-04-17 v2 信息检索
机器学习
摘要
教师与学生日益依赖在线学习资源以补充校内所提供的资源。可用资源在广度与深度上的增长对学生而言是好事,但前提是他们能找到其查询的答案。问答与信息检索系统已受益于公开数据集来训练与评估其算法,但此类数据集大多为成年人撰写及面向成年人的英文文本。我们引入一个从 Alloprof(一个基于魁北克的初高中辅导网站)收集的新公开法语问答数据集,包含来自 10 368 名学生的 29 349 个问题及其在各类学科中的解释,其中超过半数的解释含有指向其他问题或网站上 2 596 个参考页面之一的链接。我们还展示了该数据集在信息检索任务中的案例研究。该数据集采集于 Alloprof 公共论坛,所有问题均经适当性核验,解释同时经适当性及其对问题相关性核验。为预测相关文档,我们使用预训练 BERT 模型的架构被微调与评估。该数据集将使研究者能够针对法语教育语境专门开发问答、信息检索及其他算法。此外,语言熟练度、图像、数学符号与拼写错误的多样性将需要基于多模态理解的算法。我们作为基线呈现的案例研究展示了一种依赖近期技术的方法提供了可接受的性能水平,但在其能可靠用于生产环境并被信任前,仍需更多工作。
引用
@article{arxiv.2302.07738,
title = {Alloprof: a new French question-answer education dataset and its use in an information retrieval case study},
author = {Antoine Lefebvre-Brossard and Stephane Gazaille and Michel C. Desmarais},
journal= {arXiv preprint arXiv:2302.07738},
year = {2023}
}