更大的探针讲述不同故事:通过上下文学习扩展心理语言学数据集
计算与语言
2023-11-15 v3
摘要
语言模型探针常被用于测试模型的特定能力。然而,当探针基准规模小且缺乏统计功效时,此类研究的结论可能受限。本工作中,我们受心理语言学研究启发,引入用于否定(NEG-1500-SIMP)与角色反转(ROLE-1500)的新的、更大的数据集。我们利用 GPT3 大幅扩展已有的 NEG-136 与 ROLE-88 基准,将其规模从 18 与 44 个句子对分别增至 750 个。我们还创建了另一版扩展否定数据集(NEG-1500-SIMP-TEMP),使用基于模板的生成方法构建,包含 770 个句子对。我们在扩展数据集上评估了 22 个模型,发现模型性能相较原始较小基准下降 20–57%。我们观察到 BERT 与 ALBERT 等模型具有高度否定敏感性,表明此前的发现可能因测试集较小而偏倚。最后,我们观察到,尽管 GPT3 生成了 ROLE-1500 中的所有样例,其在探针测试中仅能解决其中 24.6%。数据集与代码见于 。
引用
@article{arxiv.2303.16445,
title = {Larger Probes Tell a Different Story: Extending Psycholinguistic Datasets Via In-Context Learning},
author = {Namrata Shivagunde and Vladislav Lialin and Anna Rumshisky},
journal= {arXiv preprint arXiv:2303.16445},
year = {2023}
}
备注
14 pages, 6 figures. Published as a conference paper at EMNLP 2023 (short). The datasets and code are available on this $\href{https://github.com/text-machine-lab/extending_psycholinguistic_dataset}{URL}$