中文

提升大型语言模型价值评估:基于生成式演化测试的方法

计算与语言 2025-06-12 v5 人工智能 计算机与社会

摘要

警告:本文包含有害模型输出。尽管取得了显著进展,但大型语言模型(LLM)生成有害和不道德内容的倾向仍是关键挑战。衡量LLM价值对齐性对于其监管和负责任的部署至关重要。虽然已构建了大量基准测试来评估LLM中的社会偏见、毒性和伦理问题,但这些静态基准测试存在评估时序效应,即随着模型快速发展,现有基准测试可能泄露到训练数据中或饱和,从而高估不断发展的LLM。为解决此问题,我们提出了一种基于测量理论中自适应测试方法的新型生成式演化测试方法(GETA)。不同于依赖静态测试项目库的传统自适应测试方法,GETA通过动态生成量身于模型能力的测试项目来探测LLM的底层道德边界。GETA通过学习项目难度与模型价值一致性的联合分布,与LLM共同演化,从而有效解决评估时序效应问题。我们使用GETA评估了各种流行的LLM,并证明了:1)GETA能够动态创建难度调适的测试项目;2)GETA的评估结果更符合模型在未见数据(OOD)和i.i.d.项目上的表现,为未来的评估范式奠定了基础。

关键词

引用

@article{arxiv.2406.14230,
  title  = {Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing},
  author = {Han Jiang and Xiaoyuan Yi and Zhihua Wei and Ziang Xiao and Shu Wang and Xing Xie},
  journal= {arXiv preprint arXiv:2406.14230},
  year   = {2025}
}

备注

ICML 2025