中文

您的LLM作为推荐代理可靠吗?LLM的推荐容易受到偏见(偏好)的攻击

计算机与社会 2026-03-23 v2 多智能体系统

摘要

当前的大型语言模型(Large Language Models, LLMs)正逐渐被用于深度研究、电子商务推荐和招聘等实际具有价值的智能体工作流程。在这些应用中,LLM需要从大量候选方案中选择一些最优方案,我们称之为LLM作为推荐者范例。然而,针对LLM代理用于推荐的可靠性问题几乎未得到探讨。本文引入一个偏见推荐基准(BiasRecBench),以突显此类智能体对高价值实际任务中偏见的关键脆弱性。该基准包含三个实际领域:论文审稿、电子商务和招聘。我们构建了一个带有校准质量间隙的偏见合成管道:1)控制最优选项与亚优选项之间质量差距,以提供校准的测试环境以诱发对偏见的脆弱性;2)注入适合选项上下文的逻辑偏见。针对SOTA模型(Gemini-{2.5,3}-pro、GPT-4o、DeepSeek-R1)和小规模LLM进行大量实验,结果显示尽管这些智能体拥有足够的推理能力识别真实情况,但仍频繁屈从于注入的偏见。这些发现揭示了当前智能体工作流程中的显著可靠性瓶颈,呼吁为LLM作为推荐者制定专门的对齐策略。完整的代码和评估数据集将在不久后公开。

关键词

引用

@article{arxiv.2603.17417,
  title  = {Is Your LLM-as-a-Recommender Agent Trustable? LLMs' Recommendation is Easily Hacked by Biases (Preferences)},
  author = {Zichen Tang and Zirui Zhang and Qian Wang and Zhenheng Tang and Bo Li and Xiaowen Chu},
  journal= {arXiv preprint arXiv:2603.17417},
  year   = {2026}
}