面向 NLI 模型域外推理的合成数据方法
计算与语言
2024-07-01 v2
摘要
自然语言推断 (NLI) 仍是大型语言模型 (LLMs) 的重要基准任务。NLI 数据集是其他语义任务迁移学习的跳板,NLI 模型是识别模型生成文本可信度的标准工具。目前已有多个大规模 NLI 数据集,模型通过在这些数据集上进行hill-climbing显著提升。然而,这些模型在实际的 out-of-distribution/域外数据上的表现仍鲜有了解。我们探索了使用合成高质量数据适配 NLI 模型以实现在新知未涉及的文本域中零样本应用的机会。我们展示了一种新的方法,用于生成多样化的域和长度的 NLI 数据,此类数据尚未被现有训练集覆盖。生成的示例具有有意义的前提,假设以创造性方式而非对少数前提标记进行简单编辑形式出现,并且标签具有高准确率。我们表明,在该数据(K 个合成示例)上训练的模型在完全新的下游测试设置中实现最佳泛化。在 TRUE 基准测试上,使用我们的数据训练的 T5-small 模型相较于训练在最佳替代数据集上的模型平均提升约 。对于较小的模型,这些改进更为显著,而在 T5 XXL 模型上仍具有意义的提升。我们还在域内训练数据增强我们域通用合成数据时,展示了在测试集上的提升。
引用
@article{arxiv.2402.12368,
title = {A synthetic data approach for domain generalization of NLI models},
author = {Mohammad Javad Hosseini and Andrey Petrov and Alex Fabrikant and Annie Louis},
journal= {arXiv preprint arXiv:2402.12368},
year = {2024}
}