对话蕴含任务的对抗性攻击与防御
计算与语言
2024-05-03 v2 人工智能
摘要
随着 NLP 系统在关键应用中的部署增加,确保大型语言模型 (LLM) 免受对抗性攻击的鲁棒性变得越来越重要。大型语言模型在各种 NLP 任务中表现出色,但仍然容易受到低成本对抗性攻击的威胁。我们聚焦于对话蕴含领域,其中多轮对话作为前提用于验证假设。我们对 transformer 模型进行微调,以准确判别这些假设的真实性。对手通过同义词替换来操纵假设,以欺骗模型做出错误预测。为抵御这些攻击,我们实施了创新的微调技术,并引入了嵌入扰动损失方法以显著增强模型的鲁棒性。我们的发现不仅强调了在 NLP 中防御对抗性攻击的重要性,也表明增强模型鲁棒性对于可靠的 NLP 应用具有现实意义。
引用
@article{arxiv.2405.00289,
title = {Adversarial Attacks and Defense for Conversation Entailment Task},
author = {Zhenning Yang and Ryan Krawec and Liang-Yuan Wu},
journal= {arXiv preprint arXiv:2405.00289},
year = {2024}
}