中文

基于 Shapley 值的 LLM 摘要公平文档估值

计算与语言 2026-01-08 v4 综合经济学 经济学

摘要

大型语言模型 (LLM) 正越来越多地被用于从多个来源检索和总结内容的系统中,例如搜索引擎和 AI 助手。虽然这些系统通过连贯的摘要提升了用户体验,但它们掩盖了原始内容创作者的个人贡献,引发了关于署名和补偿的担忧。我们通过提出一个基于 Shapley 值的公平文档估值框架,来解决对 LLM 生成的摘要中使用的单个文档进行估值的挑战。尽管在理论上具有吸引力,但精确的 Shapley 值计算在大规模情况下成本过高。为了提高效率,我们开发了 Cluster Shapley,这是一种简单的近似算法,利用文档间的语义相似性来减少计算,同时保持归因准确性。使用 Amazon 产品评论数据,我们实证表明,现成的 Shapley 近似方法(如 Monte Carlo sampling 和 Kernel SHAP)在 LLM 环境中表现不佳,而 Cluster Shapley 显著提升了效率-准确率边界。此外,简单的归因规则(例如均等分配或基于相关性的分配)虽然计算成本低廉,却会导致高度不公平的结果。总之,我们的发现突出了为 LLM 摘要量身定制的结构感知 Shapley 近似的潜力,并为寻求可扩展且公平的内容归因机制的平台提供了指导。

关键词

引用

@article{arxiv.2505.23842,
  title  = {Fair Document Valuation in LLM Summaries via Shapley Values},
  author = {Zikun Ye and Hema Yoganarasimhan},
  journal= {arXiv preprint arXiv:2505.23842},
  year   = {2026}
}