基于图表决:通过拓扑一致性最大化实现稳定的 RLAIF
人工智能
2026-05-26 v3
摘要
强化学习从 AI 反馈(RLAIF)依赖于 LLM 评判家作为偏好测量工具,但这些工具受限于随机测量误差——这些误差表现为偏好循环(例如 ),在最先进模型中占 5-9%。虽然多次抽样通过平均多个判断来缓解噪声,但将每个比较孤立地对待,未能利用区分系统性信号与随机噪声的结构约束。我们引入拓扑共识奖励(TCR),通过拓扑多数投票利用传递性作为去噪机制:系统性信号通过传递链相互强化,而随机错误聚集为暴露的循环。TCR 近似求解最大无环子图来过滤偏好信号中的随机噪声。我们还提出了循环发生率(CIR)作为诊断指标,用于衡量包含偏好循环的样本比例。在我们的噪声模型下,这些循环主要来自随机测量误差而非真实的不可传递性。在 Arena-Hard、MT-Bench 和 WritingBench 上的实验表明,TCR 持续优于成对基线和经典排序算法,同时在不同评判模型下表现稳健。
引用
@article{arxiv.2510.15514,
title = {Voting with the Graph: Stable RLAIF via Topological Consistency Maximization},
author = {Boyin Liu and Zhuo Zhang and Sen Huang and Lipeng Xie and Qingxu Fu and Haoran Chen and LI YU and Tianyi Hu and Zhaoyang Liu and Bolin Ding and Dongbin Zhao},
journal= {arXiv preprint arXiv:2510.15514},
year = {2026}
}