中文

KNOW 如何下定决心!对抗式检测并缓解自然语言解释中的不一致性

计算与语言 2023-06-06 v1 人工智能

摘要

尽管近期工作在显著提升模型为证明其预测而生成的自然语言解释(NLEs)质量上取得了可观进展,但关于检测并缓解所生成 NLEs 之间不一致性的研究仍极为有限。本工作中,我们利用外部知识库显著改进了现有的用于检测不一致 NLEs 的对抗攻击。我们将该攻击应用于高性能 NLE 模型,并表明 NLE 质量更高的模型未必生成更少的不一致性。此外,我们提出了一种即插即用的缓解方法,通过将模型锚定于外部背景知识来减轻不一致性。我们的方法降低了先前高性能 NLE 模型经我们的攻击所检测到不一致性。

关键词

引用

@article{arxiv.2306.02980,
  title  = {KNOW How to Make Up Your Mind! Adversarially Detecting and Alleviating Inconsistencies in Natural Language Explanations},
  author = {Myeongjun Jang and Bodhisattwa Prasad Majumder and Julian McAuley and Thomas Lukasiewicz and Oana-Maria Camburu},
  journal= {arXiv preprint arXiv:2306.02980},
  year   = {2023}
}

备注

Short paper, ACL 2023