few-shot 提示中示例选择对基于 GPT 模型的自动作文评分影响
摘要
本研究探讨了示例选择对使用 few-shot 提示对自动作文评分(AES)产生的影响。我们评估了不同 GPT-3.5 和 GPT-4 模型版本中示例选择与顺序对性能的影响。我们的实验涉及 119 个包含不同示例的提示,并计算二次加权 Kappa(QWK)以衡量 GPT 与人类评分器之间的一致性。使用回归分析定量评估示例选择引入的偏差。结果表明,示例选择对 QWK 的影响在不同模型间存在差异,GPT-3.5 对示例的敏感度高于 GPT-4。我们还发现存在多数标签偏差(majority label bias),即倾向于偏好示例中的多数标签;以及时效偏差(recency bias),即倾向于偏好最新示例的标签,这些偏差在 GPT-3.5 中更为显著。值得注意的是,谨慎选择示例后,GPT-3.5 模型可超过一些 GPT-4 模型。然而,在所有 GPT 模型中,2023 年 6 月版本的 GPT-4(虽非最新版本)表现出最高的稳定性和性能。我们的发现为理解 few-shot 提示在 AES 中的示例选择重要性提供了见解,尤其是针对 GPT-3.5 模型,并凸显了即使对每个模型(包括次要版本)都需要单独评估的必要性。
引用
@article{arxiv.2411.18924,
title = {The Impact of Example Selection in Few-Shot Prompting on Automated Essay Scoring Using GPT Models},
author = {Lui Yoshida},
journal= {arXiv preprint arXiv:2411.18924},
year = {2024}
}
备注
Accepted in AIED2024. This preprint has not undergone any post-submission improvements or corrections. The Version of Record of this contribution is published in Communications in Com-puter and Information Science, vol 2150, and is available online at https://doi.org/