辅助任务需求掩盖了较小语言模型的能力
计算与语言
2024-07-31 v2 人工智能
摘要
发展心理学家一直在争论语言理解或心智理论等认知能力何时出现。这些争论往往围绕“任务需求”这一概念——即与执行特定评估相关的辅助挑战——可能掩盖儿童潜在的能力。在衡量语言模型(LM)的能力时也会出现同样的问题:任务表现是模型潜在知识以及模型利用其可用资源解释和执行任务的能力的函数。在这里,我们表明,对于类比推理、反思推理、单词预测和语法判断,任务需求越大的评估方法产生的性能低于需求减少的评估。这种“需求差距”在参数较少、训练数据较少的模型中最为明显。我们的结果说明,LM表现不应被解释为智力(或缺乏智力)的直接指示,而是通过研究者的设计选择所看到的能力反映。
引用
@article{arxiv.2404.02418,
title = {Auxiliary task demands mask the capabilities of smaller language models},
author = {Jennifer Hu and Michael C. Frank},
journal= {arXiv preprint arXiv:2404.02418},
year = {2024}
}
备注
Published at the 1st Conference on Language Modeling (COLM 2024)