通过任务引导自适应构建模型剖析
计算与语言
2025-09-29 v3 人工智能
机器学习
摘要
语言模型评估往往无法刻画其 consequential failure modes,迫使专家去检查输出并构建新的基准。我们引入了任务引导,一种自动构建新评估以剖析模型行为的方法。任务引导发现了数百个自然语言任务——比先前工作多一个数量级——在这些任务中前沿模型表现出系统性失败,涵盖从预测到在线骚扰等多个领域。例如,我们发现 Sonnet 3.5 过度关联量子计算与 AGI,并且 o3-mini 在捏造内容在上下文中被重复时容易产生幻觉。
引用
@article{arxiv.2503.01986,
title = {Adaptively profiling models with task elicitation},
author = {Davis Brown and Prithvi Balehannina and Helen Jin and Shreya Havaldar and Hamed Hassani and Eric Wong},
journal= {arXiv preprint arXiv:2503.01986},
year = {2025}
}
备注
EMNLP 2025 Main Conference