跨多任务在 IID、OOD 与对抗设置下选择性预测方法的调研
计算与语言
2022-03-02 v1 人工智能
机器学习
摘要
为使 NLP 系统具备选择性预测能力,已有若干任务专用方法被提出。然而,哪些方法在跨任务上表现最佳,甚至它们是否持续优于最简基线“MaxProb”,仍有待探索。为此,我们在涵盖若干 NLP 任务的 17 个数据集的大规模设置下系统研究“选择性预测”。通过在域内(IID)、域外(OOD)与对抗(ADV)设置下的综合实验,我们表明:尽管利用了额外资源(留出数据/计算),现有方法无一能在所有三种设置中持续且显著优于 MaxProb。此外,它们的性能在任务间迁移不佳。例如,Monte-Carlo Dropout 在重复检测数据集上优于所有其他方法,但在 NLI 数据集上表现不佳,尤其在 OOD 设置下。因此,我们建议未来的选择性预测方法应在跨任务与跨设置下评估,以可靠估计其能力。
引用
@article{arxiv.2203.00211,
title = {Investigating Selective Prediction Approaches Across Several Tasks in IID, OOD, and Adversarial Settings},
author = {Neeraj Varshney and Swaroop Mishra and Chitta Baral},
journal= {arXiv preprint arXiv:2203.00211},
year = {2022}
}
备注
ACL 2022 Findings