利用挑战数据揭示关系抽取模型的浅层启发式
计算与语言
2020-10-09 v1
摘要
训练和标注数据的收集过程可能引入分布伪影,限制模型学习正确泛化行为的能力。我们识别出在 TACRED 上训练的 SOTA 关系抽取(RE)模型的失败模式,并将其归因于数据标注过程的局限性。我们基于自然语料实例收集并标注了一个称为挑战性关系抽取(CRE)的挑战集,以基准测试该行为。我们使用四个最先进的 RE 模型进行的实验表明,它们确实采用了无法泛化到挑战集数据的浅层启发式。此外,我们发现替代的问答建模在挑战集上显著优于 SOTA 模型,尽管其整体 TACRED 性能更差。通过将部分挑战数据添加为训练样本,模型性能得到提升。最后,我们就如何改进 RE 数据收集以缓解此行为提出具体建议。
引用
@article{arxiv.2010.03656,
title = {Exposing Shallow Heuristics of Relation Extraction Models with Challenge Data},
author = {Shachar Rosenman and Alon Jacovi and Yoav Goldberg},
journal= {arXiv preprint arXiv:2010.03656},
year = {2020}
}
备注
Accepted as a short paper in EMNLP 2020