面向 LLM 驱动推荐系统的不确定性与公平性意识
人工智能
2026-02-04 v1 计算与语言
计算机与社会
信息检索
机器学习
软件工程
摘要
大型语言模型 (LLM) 能够通过利用广泛的上下文知识实现强大的零样本推荐,但预测不确定性和内嵌偏见威胁其可靠性和公平性。本文研究不确定性和公平性评估如何影响 LLM 生成推荐的准确性、一致性和可信度。我们引入一套精选指标基准,并构建包含八个人口统计属性(31 个类别值)的标注数据集,覆盖电影和音乐两个领域。通过深入案例研究,我们量化预测不确定性(通过熵),表明 Google DeepMind 的 Gemini 1.5 Flash 在某些敏感属性上存在系统性不公平;测得的基于相似性的差距为 SNSR 为 0.1363,SNSV 为 0.0507。这些差异在提示词扰动(如拼写错误和多语言输入)下仍然存在。我们进一步将人格感知公平性整合到 RecLLM 评估管道中,以揭示人格关联偏差模式并暴露个性化与群体公平性之间的权衡。我们提出一种新型不确定性感知评估方法,展示来自深度不确定性案例研究的经验见解,并引入基于人格轮廓的公平性基准,以推动 LLM 推荐的可解释性和平等性。总体而言,这些贡献为更安全、更可解释的 RecLLM 奠定了基础,并激励未来工作开展多模型基准和自适应校准以实现可信部署。
引用
@article{arxiv.2602.02582,
title = {Uncertainty and Fairness Awareness in LLM-Based Recommendation Systems},
author = {Chandan Kumar Sah and Xiaoli Lian and Li Zhang and Tony Xu and Syed Shazaib Shah},
journal= {arXiv preprint arXiv:2602.02582},
year = {2026}
}
备注
Accepted at the Second Conference of the International Association for Safe and Ethical Artificial Intelligence, IASEAI26, 14 pages