NatLogAttack:一种基于自然逻辑攻击自然语言推理模型的框架
计算与语言
2024-10-14 v2
摘要
推理自人工智能之初便是核心议题。分布式表示与神经网络近期取得的进展持续提升自然语言推理的先进水平。然而,模型究竟是借助真实推理得出结论,还是依赖虚假相关性,仍是一个开放问题。对抗攻击已被证明是评估受害模型阿喀琉斯之踵的重要工具。在本研究中,我们探究基于逻辑形式开发攻击模型这一根本问题。我们提出 NatLogAttack,围绕自然逻辑展开系统性攻击;自然逻辑是一种经典逻辑形式,可追溯至亚里士多德三段论,并一直为自然语言推理紧密发展。所提框架可生成保持标签与翻转标签两类攻击。我们表明,相较现有攻击模型,NatLogAttack 以更少的受害模型访问次数生成更优对抗样本。发现受害模型在标签翻转设定下更为脆弱。NatLogAttack 提供了一个从关键视角探查现有及未来 NLI 模型能力的工具,我们希望更多基于逻辑的攻击被进一步探索,以理解推理的期望属性。
引用
@article{arxiv.2307.02849,
title = {NatLogAttack: A Framework for Attacking Natural Language Inference Models with Natural Logic},
author = {Zi'ou Zheng and Xiaodan Zhu},
journal= {arXiv preprint arXiv:2307.02849},
year = {2024}
}
备注
Published as a conference paper at ACL 2023