纠正稀疏用户反馈中选择偏差:面向大语言模型质量估计的多智能体层次贝叶斯方法
计算与语言
2026-05-13 v1
摘要
[略] 生产级大语言模型部署接收来自非随机用户比例的反馈:赞美掌握在满足分布尾部的用户中,对其进行简单平均可能使系统质量估计偏离真实值高达40-50个百分点。我们将其视为一种主题和情感分层的选择偏差问题,提出一种无需对 individual 交互ground-truth标签的三智能体层次贝叶斯管道。话题聚类智能体通过UMAP+HDBSCAN对文本嵌入进行聚类;偏差建模智能体在NUTS下拟合两阶段层次Beta-Binomial模型,推断每个主题的选择率 和质量 ,并采用部分池化;合成智能体按真实话题分布 对 进行加权,以报告偏差校正后的总体后验 及其可信区间,外加用于在线 recalibration 的漂移信号。验证使用UltraFeedback(保留 条交互, 个簇,) ,并加入仿真的话题和情感依赖的选择偏差。我们将五种贝叶斯变体与Naive和IPW基线进行比较。在反馈通道(典型的正反馈率和负向正向比率,均可从任何生产仪表盘无标签读取)上施加温和先验,层次化-Informed 方法在偏差比从1:1扫升至30:1期间,均在 附近4-13 pp,且在 时,50/50随机种子复制中95%可信区间覆盖 。若不使用通道侧先验,则每个弱先验变体均偏离 22-33 pp:每个簇的充分统计量允许一族等价拟合,而对偏差通道(而非潜在质量)的先验正是打破这种退化的关键。
引用
@article{arxiv.2605.12177,
title = {Correcting Selection Bias in Sparse User Feedback for Large Language Model Quality Estimation: A Multi-Agent Hierarchical Bayesian Approach},
author = {Andrea Morandi and Mahesh Viswanathan},
journal= {arXiv preprint arXiv:2605.12177},
year = {2026}
}