中文

训练数据比你想象的更有价值:一种从训练数据中检索的简单有效方法

计算与语言 2022-03-17 v1 人工智能 信息检索

摘要

基于检索的方法已通过引入外部知识被证明在NLP任务中有效。然而,大规模语料的索引与检索带来了可观的计算成本。令人惊讶的是,我们发现仅从训练数据(REINA)中检索(REtrieving from the traINing datA)就能在多个NLG与NLU任务上带来显著收益。我们检索与输入文本最相似的带标签训练实例,然后将它们与输入拼接输入模型以生成输出。实验结果表明,这一简单方法能在包括摘要、机器翻译、语言建模与问答任务在内的多种NLU和NLG任务上取得显著更优性能。例如,我们提出的方法在XSum、BigPatent和CommonsenseQA上取得了SOTA结果。我们的代码已发布:https://github.com/microsoft/REINA。

关键词

引用

@article{arxiv.2203.08773,
  title  = {Training Data is More Valuable than You Think: A Simple and Effective Method by Retrieving from Training Data},
  author = {Shuohang Wang and Yichong Xu and Yuwei Fang and Yang Liu and Siqi Sun and Ruochen Xu and Chenguang Zhu and Michael Zeng},
  journal= {arXiv preprint arXiv:2203.08773},
  year   = {2022}
}

备注

Accept to ACL 2022 main conference