中文

(为什么PHI) 微调PHI-3以进行多选题回答:方法、结果与挑战

计算与语言 2025-01-06 v1 人工智能

摘要

大型语言模型(LLM)因其在理解和生成类人文本方面的卓越能力,已成为各个领域的重要工具。准确回答多选题(MCQs)的能力在教育领域具有重要价值,尤其是在自动化辅导系统和评估平台中。然而,由于幻觉现象和模糊的提示,使LLM适应MCQs任务具有挑战性。本文探讨了微软PHI-3 \cite{Abdin2024}——一种紧凑且高效的LLM——用于MCQs回答的潜力。我们的贡献包括在TruthfulQA数据集上对模型进行微调、设计优化提示以提升模型性能,并使用困惑度和传统指标(如准确率和F1分数)进行评估。结果表明,PHI-3.5在微调后MCQs处理能力显著提升,困惑度从4.68降至2.27,准确率从62%提升至90.8%。本研究凸显了高效模型在自适应学习系统和教育评估中的重要性,为在教室中更广泛地集成铺垫了道路,尤其是在考试准备、学生反馈和个性化学习等领域。

关键词

引用

@article{arxiv.2501.01588,
  title  = {(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges},
  author = {Mohamed Hisham Abdellatif},
  journal= {arXiv preprint arXiv:2501.01588},
  year   = {2025}
}