基于面向大语言模型自探索的自动能力发现
高能物理 - 唯象学
2025-04-08 v2
摘要
Foundation models 已成为通用助手,通过在 web 规模数据上训练,在诸多领域展现出多样化的能力。然而,要精确表征这些能力和潜在风险的完整光谱仍具挑战性。现有的评估方法往往需要大量人工 effort,并且随着模型能力的提升,设计日益艰巨的挑战以应对更强大的模型也日益困难。我们引入 Automated Capability Discovery (ACD),一个将一个 foundation model designated 为 scientist 以系统性提出探索 subject model(可能是自身)能力的 open-ended 任务的框架。通过将前沿模型与开放性思想结合,ACD 自动且系统地揭示了 subject model 中惊人的一系列能力和失效现象。我们在多个 foundation model(包括 GPT、Claude 和 Llama 系列)上演示 ACD,表明它自动生成数千个独特任务,并通过聚类揭示数十个更广泛的能力领域和失效模式,这对任何单一团队而言都难以发现。我们进一步通过大量人类调查验证了该方法的自动评分,观察到模型生成和人类评估之间高度一致。通过利用 foundation models 既能创建任务又能自我评估的能力,ACD 是向可扩展、自动化评估新型 AI 系统迈出的重要一步。所有代码和评估日志均开源于 https://github.com/conglu1997/ACD。
引用
@article{arxiv.2502.07576,
title = {One-loop matching for leading-twist generalised transverse-momentum-dependent distributions},
author = {Valerio Bertone and Miguel G. Echevarria and Óscar del Rio and Simone Rodini},
journal= {arXiv preprint arXiv:2502.07576},
year = {2025}
}
备注
27 pages, 3 figures