利用反事实度量并改进对部分输入的注意力
计算与语言
2024-10-10 v2
摘要
训练数据中伪相关的必然出现损害了 NLP 模型在未见数据上的泛化能力。先前工作发现,具有成对输入的数据集容易在输入的特定部分(例如 NLI 中的假设)与标签之间产生相关性;因此,仅在这些数据上训练的模型表现优于随机基线。在完整输入数据上训练的模型是否会习得这些相关性?为解答该问题,我们提出了一种新的评估方法——反事实注意力测试(CAT)。CAT 通过将输入的一部分替换为来自不同示例的对应部分(受某些限制)来使用反事实,期望具有注意力的模型改变其预测。利用 CAT,我们系统地研究了在十个数据集、四项任务上的已确立的监督式与上下文学习模型:自然语言推理、阅读理解、释义检测和视觉与语言推理。CAT 揭示,对此类相关性的依赖主要取决于数据。令人惊讶的是,我们发现 GPT3 随着演示数量增加而注意力下降,但其在测试数据上的准确率却提升。我们的结果表明,用反事实增强训练或演示数据可有效提升模型的注意力。我们表明,由 CAT 度量的模型注意力揭示了与仅度量数据中的相关性不同的结论。
引用
@article{arxiv.2311.09605,
title = {Measuring and Improving Attentiveness to Partial Inputs with Counterfactuals},
author = {Yanai Elazar and Bhargavi Paranjape and Hao Peng and Sarah Wiegreffe and Khyathi Raghavi and Vivek Srikumar and Sameer Singh and Noah A. Smith},
journal= {arXiv preprint arXiv:2311.09605},
year = {2024}
}
备注
Findings of EMNLP 2024