中文

纠正稀疏用户反馈中选择偏差:面向大语言模型质量估计的多智能体层次贝叶斯方法

计算与语言 2026-05-13 v1

摘要

[略] 生产级大语言模型部署接收来自非随机用户比例的反馈:赞美掌握在满足分布尾部的用户中,对其进行简单平均可能使系统质量估计偏离真实值高达40-50个百分点。我们将其视为一种主题和情感分层的选择偏差问题,提出一种无需对 individual 交互ground-truth标签的三智能体层次贝叶斯管道。话题聚类智能体通过UMAP+HDBSCAN对文本嵌入进行聚类;偏差建模智能体在NUTS下拟合两阶段层次Beta-Binomial模型,推断每个主题的选择率 scs_c 和质量 qcq_c,并采用部分池化;合成智能体按真实话题分布 π^c=nc/N\hat\pi_c = n_c/Nqcq_c 进行加权,以报告偏差校正后的总体后验 Qˉ=cπ^cqc\bar Q = \sum_c \hat\pi_c q_c 及其可信区间,外加用于在线 recalibration 的漂移信号。验证使用UltraFeedback(保留 N=10,232N=10,232 条交互,C=18C=18 个簇,Q=0.6249Q^\star=0.6249) ,并加入仿真的话题和情感依赖的选择偏差。我们将五种贝叶斯变体与Naive和IPW基线进行比较。在反馈通道(典型的正反馈率和负向正向比率,均可从任何生产仪表盘无标签读取)上施加温和先验,层次化-Informed 方法在偏差比从1:1扫升至30:1期间,均在 QQ^\star 附近4-13 pp,且在 κmax=10\kappa_{\max}=10 时,50/50随机种子复制中95%可信区间覆盖 QQ^\star。若不使用通道侧先验,则每个弱先验变体均偏离 QQ^\star 22-33 pp:每个簇的充分统计量允许一族等价拟合,而对偏差通道(而非潜在质量)的先验正是打破这种退化的关键。

关键词

引用

@article{arxiv.2605.12177,
  title  = {Correcting Selection Bias in Sparse User Feedback for Large Language Model Quality Estimation: A Multi-Agent Hierarchical Bayesian Approach},
  author = {Andrea Morandi and Mahesh Viswanathan},
  journal= {arXiv preprint arXiv:2605.12177},
  year   = {2026}
}