中文

有限标注下的通用自然语言处理:以少样本文本蕴含作为起点

计算与语言 2020-10-07 v1

摘要

解决不同 NLP 问题的一种标准方式是先构建特定于问题的数据集,再建立拟合该数据集的模型。为构建终极人工智能,我们希望单一机器能处理多样的新问题,而这类问题特定标注有限。我们提出将文本蕴含作为此类 NLP 问题的统一求解器。然而,当前文本蕴含研究对以下问题着墨不多:(i)预训练的文本蕴含系统在仅含少量领域特定样本时,跨领域的泛化能力如何?以及(ii)何时值得将 NLP 任务转化为文本蕴含?我们认为,若能获得该任务的丰富标注,则这种转化是不必要的。文本蕴含真正重要尤其体现在目标 NLP 任务标注不足时。通用 NLP 或许可通过不同路径实现。本工作中,我们提出通用少样本文本蕴含(UFO-Entail)。我们证明该框架使预训练的蕴含模型在少样本设定下能良好地在新蕴含领域工作,并展示了当端任务标注有限时,其作为问答和共指消解等若干下游 NLP 任务统一求解器的有效性。代码:https://github.com/salesforce/UniversalFewShotNLP

关键词

引用

@article{arxiv.2010.02584,
  title  = {Universal Natural Language Processing with Limited Annotations: Try Few-shot Textual Entailment as a Start},
  author = {Wenpeng Yin and Nazneen Fatema Rajani and Dragomir Radev and Richard Socher and Caiming Xiong},
  journal= {arXiv preprint arXiv:2010.02584},
  year   = {2020}
}

备注

EMNLP2020 Long, camera-ready