AdAEM:一种自适应自动可扩展测量 LLMs 价值差异的方法
计算机与社会
2026-03-09 v2 人工智能
计算与语言
摘要
评估大语言模型(Large Language Models, LLMs)底层的价值差异有助于全面比较其误差倾向、文化适应性和偏见。然而,当前的价值测量方法面临信息性挑战:由于常常过时、受污染或泛泛的测试问题,只能捕捉到关于评论安全价值(如 HHH)等在不同 LLMs 之间共享的倾向,导致结果难以区分且缺乏信息。为此,我们引入 AdAEM,一种新型自可扩展评估算法,用于揭示 LLMs 的倾向。与静态基准不同,AdAEM 自动且自适应地生成和扩展其测试问题。这一过程通过以 in-context 优化方式探测由不同文化和时间段开发的多样化 LLMs 的内部价值边界,从而在理论上最大化信息论目标,以提取能够提供更具区分性和信息性洞察的争议性话题。如此,AdAEM 能够与 LLMs 的发展共生,持续跟踪其价值动态。我们使用 AdAEM 生成新问题并进行大规模分析,证明了该方法的有效性和有效性,为改进跨学科研究 LLMs 的价值和对齐奠定了基础。代码和生成的评估问题已发布于 https://github.com/ValueCompass/AdAEM。
引用
@article{arxiv.2505.13531,
title = {AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference},
author = {Jing Yao and Shitong Duan and Xiaoyuan Yi and Dongkuan Xu and Peng Zhang and Tun Lu and Ning Gu and Zhicheng Dou and Xing Xie},
journal= {arXiv preprint arXiv:2505.13531},
year = {2026}
}
备注
This paper is accepted by ICLR 2026(Oral)