中文

UnibucLLM:利用大型语言模型自动预测选择题难度与作答时间

计算与语言 2024-04-23 v1 人工智能 机器学习

摘要

本工作探索了一种基于大型语言模型 (LLM) 的新型数据增强方法,用于预测 BEA 2024 共享任务中已退役的美国医学师考试 (USMLE) 选择题难度和作答时间。我们的方法基于使用零-shot LLM (Falcon、Meditron、Mistral) 生成答案来增强数据集,并采用基于六种不同特征组合的 transformer 模型。结果表明,预测题目难度更具挑战性。值得注意的是,我们的最佳方法始终包括问题文本,并从 LLM 答案的变异性中受益,这凸显了 LLM 在提高医学执照考试自动评估方面的潜力。我们已公开代码 https://github.com/ana-rogoz/BEA-2024。

关键词

引用

@article{arxiv.2404.13343,
  title  = {UnibucLLM: Harnessing LLMs for Automated Prediction of Item Difficulty and Response Time for Multiple-Choice Questions},
  author = {Ana-Cristina Rogoz and Radu Tudor Ionescu},
  journal= {arXiv preprint arXiv:2404.13343},
  year   = {2024}
}

备注

Accepted at BEA 2024 (NAACL Workshop)