INTERPOL:通过插值偏好学习去匿名化 LM Arena
人工智能
2026-03-17 v1
摘要
LM Arena等基于投票的排行榜的关键在于模型响应的严格匿名性。虽然先前研究尝试使用简单的统计特征如TF-IDF或词袋模型来破坏这一假设,但这些方法往往缺乏区分相似或同一家族模型的判别力。为克服这些限制并暴露其危害性,我们引入INTERPOL,一种基于插值偏好学习的模型驱动识别框架。具体而言,INTERPOL通过合成硬负采样并采用自适应课程学习策略,捕获超统计特征所忽略的深层风格模式。大量实验表明,INTERPOL在识别准确率上显著优于现有基线方法。进一步,我们通过对Arena战斗数据进行排名操纵模拟,量化了我们发现的实际威胁。
引用
@article{arxiv.2603.15220,
title = {InterPol: De-anonymizing LM Arena via Interpolated Preference Learning},
author = {Minsung Cho and Jaehyung Kim},
journal= {arXiv preprint arXiv:2603.15220},
year = {2026}
}