利用 LLM 生成式数据增强提升问答中的分布鲁棒性
计算与语言
2024-02-12 v2 人工智能
摘要
自然语言处理中的鲁棒性仍是一个突出问题,最先进模型在自然偏移分布下表现不佳。在问答领域,关于领域自适应方法的研究持续增多。然而,在自然分布偏移下未知目标领域的领域泛化概念极少受到关注。随着生成模型质量与可及性的大幅提升,我们回答以下问题:生成的数据集如何在自然分布偏移下影响 QA 模型性能?我们在 4 个不同数据集上于不同程度的分布偏移下开展实验,并分析“真实环境”生成如何助力实现领域泛化。我们采用两步生成方法,同时生成上下文与 QA 对以增强现有数据集。通过实验,我们展示了用生成数据增强阅读理解数据集可提升对自然分布偏移的鲁棒性。
引用
@article{arxiv.2309.06358,
title = {Generative Data Augmentation using LLMs improves Distributional Robustness in Question Answering},
author = {Arijit Ghosh Chowdhury and Aman Chadha},
journal= {arXiv preprint arXiv:2309.06358},
year = {2024}
}
备注
10 tables, 1 figure, To appear at EACL 2024 Student Research Workshop