中文

FairEval:基于人格感知评估 LLM 推荐公平性

信息检索 2025-04-11 v1 人工智能 人机交互

摘要

近期大型语言模型(LLM)的进展使其应用于推荐系统(RecLLMs)成为可能,但关于跨人口统计和心理用户维度的公平性仍存关切。我们引入 FairEval,一个用于系统性评估 LLM 基于推荐公平性的新型评估框架。FairEval 将人格特质与八种敏感人口统计属性整合,其中包括性别、种族和年龄,使能够全面评估用户层面的偏见。我们在音乐和电影推荐任务上评估了包括 ChatGPT 4o 和 Gemini 1.5 Flash 在内的模型。FairEval 的公平性指标 PAFS 对于 ChatGPT 4o 达到最高 0.9969,对于 Gemini 1.5 Flash 达到 0.9997,差异可达 34.79 百分比。这些结果凸显了提示敏感性鲁棒性的重要性,并支持更具包容性的推荐系统。

关键词

引用

@article{arxiv.2504.07801,
  title  = {FairEval: Evaluating Fairness in LLM-Based Recommendations with Personality Awareness},
  author = {Chandan Kumar Sah and Xiaoli Lian and Tony Xu and Li Zhang},
  journal= {arXiv preprint arXiv:2504.07801},
  year   = {2025}
}

备注

11 pages, 5 figures, under review at a top-tier ACM conference in recommender systems