中文

评估 LLM 在职业规划中的表现:非洲十国计算能力推荐的比较分析

计算机与社会 2026-02-02 v2 人工智能

摘要

雇主日益期望毕业生在职场中运用大型语言模型(LLM),然而,尽管非洲各国情境各不相同,但面向计算职业的能力要求仍不明确。本研究考察了六种 LLM(ChatGPT-4、DeepSeek、Gemini、Claude 3.5、Llama 3 和 Mistral AI)如何描述非洲十个国家中初级计算职业的期望。基于计算课程 2020 框架,运用数字殖民主义理论和 Ubuntu 哲学,对 60 份 LLM 回应进行内容分析,发现技术能力(如云计算和编程)覆盖较为一致,但在非技术能力(尤其是伦理与负责任 AI 使用)方面存在显著差异。各模型在识别国家特定因素方差异显著,包括本地技术生态系统、语言要求和国家政策,整体情境意识率仅为 35.4%。开源模型在情境意识方面表现更好,技术与专业技能的平衡度也更高,Llama(4.47/5)和 DeepSeek(4.25/5)超越了专有模型 ChatGPT-4(3.90/5)和 Claude(3.46/5)。然而,Mistral 的情境表现极差(0.00/4),尽管为开源模型,表明开发哲学本身并不保证情境响应性。本研究是首次对非洲计算学生职业规划中 LLM 的全面比较,揭示了 entrenched infrastructure assumptions and Western-centric biases,这些因素在技术建议与当地现实之间制造了鸿沟。研究结果挑战了在资源受限环境中 AI 工具质量的假设,强调在教育中需要去殖民化方法,强调情境相关性和混合人机指导模型。

关键词

引用

@article{arxiv.2510.18902,
  title  = {Evaluating LLMs for Career Guidance: Comparative Analysis of Computing Competency Recommendations Across Ten African Countries},
  author = {Precious Eze and Stephanie Lunn and Bruk Berhane},
  journal= {arXiv preprint arXiv:2510.18902},
  year   = {2026}
}

备注

42 pages, 5 figures, 5 tables. Submitted to Computers & Education Open