中文

语言模型基项目生成的提示策略:在小型与大型语言模型之间架构差距

计算与语言 2025-08-29 v1 人工智能

摘要

本研究探索了使用语言模型进行自动项目生成(AIG),以创建形态学评估的多选题,旨在减少手动测试开发的成本和不一致性。该研究采用两种方法:首先,比较了经过微调的中等规模模型(Gemma,2B)与更大规模未微调模型(GPT-3.5,175B)。其次,评估了七种结构化提示策略,包括零shot、few-shot、链式思维、角色基、顺序以及组合策略。对生成的项目采用自动化指标和专家评分进行评估,涵盖五个维度。我们还使用 GPT-4.1 在专家评分样本上进行训练,以大规模模拟人类评分。结果表明,结构化提示,尤其是结合链式思维和顺序设计的策略,显著改善了 Gemma 的输出。Gemma 通常产生更符合 construct 对齐且指令上更合适的项目,优于 GPT-3.5 的零shot 响应,提示设计在中等规模模型性能中起着关键作用。这一研究表明,结构化提示和高效微调可在数据有限条件下提升中等规模模型用于 AIG 的性能。我们强调了结合自动化指标、专家判断和大模型模拟以确保与评估目标一致的价值。该提出的工作流程为 K-12 教育语言评估项目的开发与验证提供了实用且可扩展的方案。

关键词

引用

@article{arxiv.2508.20217,
  title  = {Prompting Strategies for Language Model-Based Item Generation in K-12 Education: Bridging the Gap Between Small and Large Language Models},
  author = {Mohammad Amini and Babak Ahmadi and Xiaomeng Xiong and Yilin Zhang and Christopher Qiao},
  journal= {arXiv preprint arXiv:2508.20217},
  year   = {2025}
}