面向软定理证明器的逻辑一致对抗攻击
机器学习
2022-05-03 v1 计算与语言
密码学与安全
摘要
AI 界近期努力在利用语言模型对自然语言句子进行“软定理证明”方面取得了令人印象深刻的成果。我们提出一种新颖的生成对抗框架,用于探查并改进这些模型的推理能力。该领域的对抗攻击存在逻辑不一致问题,即输入扰动可能改变标签。我们的逻辑一致对抗攻击者 LAVA 通过结合结构化生成过程与符号求解器来解决此问题,保证逻辑一致性。我们的框架成功生成对抗攻击并识别出多个目标模型共有的全局弱点。分析揭示了这些模型推理能力中的朴素启发式与漏洞,暴露出其在逻辑程序下对逻辑演绎的不完全掌握。最后,除有效探查这些模型外,我们表明在生成样本上训练可提升目标模型的性能。
引用
@article{arxiv.2205.00047,
title = {Logically Consistent Adversarial Attacks for Soft Theorem Provers},
author = {Alexander Gaskell and Yishu Miao and Lucia Specia and Francesca Toni},
journal= {arXiv preprint arXiv:2205.00047},
year = {2022}
}
备注
IJCAI-ECAI 2022