中文

利用对抗式改写任务改进复述检测

计算与语言 2021-06-16 v1 人工智能

摘要

如果两个句子含义相同,则它们在推理性质上应当等价,即每个句子都应文本蕴含另一个。然而,当前广泛使用的许多复述数据集依赖于基于词重叠与句法的复述概念。我们能否转而教导它们以利用句子的推理性质来识别复述,而非过度依赖句子对的词汇与句法相似性?我们将对抗范式应用于此问题,并引入一种用于复述识别的数据集创建的对抗新方法:对抗式改写任务(APT),其要求参与者生成语义等价(在相互蕴含意义上)但词汇与句法迥异的复述。这些句子对随后既可用于测试复述识别模型(其准确率仅略高于随机),也可用于提升其性能。为加速数据集生成,我们探索使用 T5 自动化 APT,并表明所得数据集同样提升了准确率。我们讨论了其对复述检测的意义,并发布我们的数据集,期望使复述检测模型更能检测句子级含义等价。

关键词

引用

@article{arxiv.2106.07691,
  title  = {Improving Paraphrase Detection with the Adversarial Paraphrasing Task},
  author = {Animesh Nighojkar and John Licato},
  journal= {arXiv preprint arXiv:2106.07691},
  year   = {2021}
}