中文

UFO:基于自我对弈微调的公平化框架用于 LLM 驱动的推荐系统

信息检索 2025-11-25 v1

摘要

大型语言模型驱动的推荐系统(LRS)通过整合预训练与监督微调(SFT)展示了优越的推荐性能,但该方法引入了项目侧不公平。现有研究主要归因于 SFT 期间缺乏公平约束,试图通过重加权和重排序方法缓解不公平问题。本文我们发现,不公平不仅源于 SFT,还源于预训练,在 SFT 中放大了固有的偏见。这一发现凸显了当前方法未能解决不公平根本原因的失败。此外,现有方法在保持满意的推荐性能方面存在困难。为解决这些问题,我们提出了基于自我对弈机制的 Unfair-to-Fair evOlving(UFO)框架,将不公平缓解形式化为两人游戏。UFO 在两个玩家角色之间交替工作:"判官"从预训练和 SFT 中识别不公平,"修正者"在识别不公平的同时调整 LRS 以保持推荐性能。玩家之间的迭代优化使 UFO 能够完全解决不公平问题。大量实验表明,UFO 有效缓解了不公平,同时提升了推荐性能。

关键词

引用

@article{arxiv.2511.18342,
  title  = {UFO: Unfair-to-Fair Evolving Mitigates Unfairness in LLM-based Recommender Systems via Self-Play Fine-tuning},
  author = {Jiaming Zhang and Yuyuan Li and Xiaohua Feng and Zhifei Ren and Li Zhang and Chaochao Chen},
  journal= {arXiv preprint arXiv:2511.18342},
  year   = {2025}
}