评估大语言模型在计算领域的个性化AI指导
计算与语言
2024-12-16 v1 人工智能
摘要
本文对三个最先进的大语言模型(LLM)在计算领域个性化职业指导中的表现进行了深入评估,使用了三个不同的学生画像,考虑了性别、种族和专业水平。我们使用零样本学习方法,在无人干预的情况下评估了 GPT-4、LLaMA 3 和 Palm 2 的性能。通过定制的自然语言处理分析流程进行了定量评估,以突出回答的独特性并识别反映每个学生画像的词语,包括种族、性别或专业水平。对回答中高频用词的分析表明,GPT-4 相比其他两个 LLM 提供了更个性化的指导。此外,还进行了定性评估,以观察人类专家是否得出类似的结论。对调查问卷回答的分析表明,GPT-4 在提供更准确和有用的指导的同时,在应对鼓励性语言方面的特定挑战上优于其他两个 LLM。我们的工作为基于 LLM 开发个性化指导工具奠定了基础,将人类导师纳入过程中,以提供更具影响力和定制化的指导体验。
引用
@article{arxiv.2412.08430,
title = {Assessing Personalized AI Mentoring with Large Language Models in the Computing Field},
author = {Xiao Luo and Sean O'Connell and Shamima Mithun},
journal= {arXiv preprint arXiv:2412.08430},
year = {2024}
}