勿归咎于标注者:偏差早已始于标注指令
计算与语言
2024-03-21 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
近年来,自然语言理解(NLU)的进展由基准数据集推动。这些基准通常通过众包收集,标注者根据数据集创建者编写的标注指令撰写样例。在本工作中,我们假设标注者会注意到众包指令中的模式,这些模式使它们偏向于写出许多相似样例,进而在收集的数据中过度代表。我们研究了这种称为指令偏差(instruction bias)的偏差形式,在14个近期NLU基准中,表明指令样例常表现出具体模式,并由众包工作者传播到收集的数据中。这扩展了先前工作(Geva et al., 2019)并提出了新的担忧:我们究竟是在建模数据集创建者的指令,还是任务本身。通过一系列实验,我们表明指令偏差确实会导致模型性能的高估,且模型难以泛化到超出源于众包指令的偏差。我们进一步从模式频率和模型规模角度分析指令偏差的影响,并给出创建未来NLU基准的具体建议。
引用
@article{arxiv.2205.00415,
title = {Don't Blame the Annotator: Bias Already Starts in the Annotation Instructions},
author = {Mihir Parmar and Swaroop Mishra and Mor Geva and Chitta Baral},
journal= {arXiv preprint arXiv:2205.00415},
year = {2024}
}
备注
EACL 2023 (Outstanding Paper Award)