DKE-Research 在 SemEval-2024 任务2:结合生成模型的数据增强与生物医学知识以增强推理鲁棒性
计算与语言
2024-04-16 v1
摘要
安全可靠的自然语言推理对于从临床试验报告中提取见解至关重要,但由于大型预训练语言模型中的偏差,这带来了挑战。本文提出了一种新颖的数据增强技术,以提高临床试验中生物医学自然语言推理的模型鲁棒性。通过语义扰动和领域特定词汇替换生成合成示例,并添加数值和定量推理的新任务,我们引入了更大的多样性并减少了捷径学习。我们的方法结合了多任务学习和DeBERTa架构,与原始语言模型相比,在NLI4CT 2024基准上取得了显著的性能提升。消融研究验证了每种增强方法在提高鲁棒性方面的贡献。在32个参与者中,我们表现最佳的模型在忠实度方面排名第12,在一致性方面排名第8。
引用
@article{arxiv.2404.09206,
title = {DKE-Research at SemEval-2024 Task 2: Incorporating Data Augmentation with Generative Models and Biomedical Knowledge to Enhance Inference Robustness},
author = {Yuqi Wang and Zeqiang Wang and Wei Wang and Qi Chen and Kaizhu Huang and Anh Nguyen and Suparna De},
journal= {arXiv preprint arXiv:2404.09206},
year = {2024}
}