我该去哪上学?有偏见的语言模型说了算!评估学术推荐中语言模型的公平性
计算与语言
2025-11-13 v2 人工智能
摘要
大型语言模型 (LLM) 越来越多地被用作日常推荐系统,用于教育规划等任务,然而它们的推荐有可能延续社会偏见。本文实证检验了三个开源 LLM(LLaMA-3.1-8B、Gemma-7B 和 Mistral-7B)在大学和专业推荐中的地理、人口和经济偏见。使用 360 个按性别、国籍和经济状况变化的模拟用户配置文件,我们分析了超过 25,000 条推荐。结果显示出强烈的偏见:全球北方的机构受到不成比例的青睐,推荐往往强化性别刻板印象,且机构重复现象普遍。尽管 LLaMA-3.1 实现了最高的多样性,推荐了覆盖 58 个国家的 481 所独特大学,但系统性差异依然存在。为了量化这些问题,我们提出了一个超越准确性的新型多维评估框架,通过衡量人口和地理代表性来进行评估。我们的研究结果突显了在教育 LLM 中考虑偏见的迫切需要,以确保全球公平接受高等教育的机会。
引用
@article{arxiv.2509.04498,
title = {Where Should I Study? Biased Language Models Decide! Evaluating Fairness in LMs for Academic Recommendations},
author = {Krithi Shailya and Akhilesh Kumar Mishra and Gokul S Krishnan and Balaraman Ravindran},
journal= {arXiv preprint arXiv:2509.04498},
year = {2025}
}
备注
Accepted at IJCNLP-AACL 2025 Findings