UnibucLLM:利用大型语言模型自动预测选择题难度与作答时间
计算与语言
2024-04-23 v1 人工智能
机器学习
摘要
本工作探索了一种基于大型语言模型 (LLM) 的新型数据增强方法,用于预测 BEA 2024 共享任务中已退役的美国医学师考试 (USMLE) 选择题难度和作答时间。我们的方法基于使用零-shot LLM (Falcon、Meditron、Mistral) 生成答案来增强数据集,并采用基于六种不同特征组合的 transformer 模型。结果表明,预测题目难度更具挑战性。值得注意的是,我们的最佳方法始终包括问题文本,并从 LLM 答案的变异性中受益,这凸显了 LLM 在提高医学执照考试自动评估方面的潜力。我们已公开代码 https://github.com/ana-rogoz/BEA-2024。
引用
@article{arxiv.2404.13343,
title = {UnibucLLM: Harnessing LLMs for Automated Prediction of Item Difficulty and Response Time for Multiple-Choice Questions},
author = {Ana-Cristina Rogoz and Radu Tudor Ionescu},
journal= {arXiv preprint arXiv:2404.13343},
year = {2024}
}
备注
Accepted at BEA 2024 (NAACL Workshop)