自然语言推理数据集与模型中偏差的统计剖析
计算与语言
2021-02-10 v1 人工智能
摘要
近期研究表明,许多自然语言理解与推理数据集中包含统计线索,NLP 模型可能利用这些线索,从而导致对其能力的高估。为发现模型中潜在的弱点,已有一些人工设计的压力测试被提出,但其构建成本高昂且无法推广到任意模型。我们提出了一种轻量级且通用的统计剖析框架 ICQ(I-See-Cue),它无需构造任何额外测试用例即可自动识别任意多选式 NLU 数据集中可能存在的偏差,并通过黑盒测试进一步评估模型利用这些偏差的程度。
引用
@article{arxiv.2102.04632,
title = {Statistically Profiling Biases in Natural Language Reasoning Datasets and Models},
author = {Shanshan Huang and Kenny Q. Zhu},
journal= {arXiv preprint arXiv:2102.04632},
year = {2021}
}