中文

PCC:基于 Bottom-k 采样与循环学习的课程数据增强复述方法

计算与语言 2023-02-01 v3

摘要

课程数据增强(CDA)通过由易到难地呈现合成数据来改进神经模型。然而,传统 CDA 简单地将词扰动比例作为难度度量,并且仅单次遍历课程。本文提出 \textbf{PCC}:基于 Bottom-k 采样与循环学习的课程数据增强 \textbf{P}araphrasing with \textbf{B}ottom-k Sampling and \textbf{C}yclic Learning for \textbf{C}urriculum Data Augmentation,一种通过复述的新型 CDA 框架,其利用文本复述相似度作为课程难度度量。我们提出一个由三个单元组成的课程感知复述生成模块:带 bottom-k 采样的复述候选生成器、过滤机制和难度度量。我们还提出一种多次遍历课程的循环学习策略。bottom-k 采样用于为后续课程生成超难样本。在少样本文本分类以及对话生成上的实验结果表明,PCC 超越了具有竞争力的基线。人工评估与大量案例分析表明,bottom-k 采样能有效生成超难样本,且 PCC 显著改进了基线对话智能体。

关键词

引用

@article{arxiv.2208.08110,
  title  = {PCC: Paraphrasing with Bottom-k Sampling and Cyclic Learning for Curriculum Data Augmentation},
  author = {Hongyuan Lu and Wai Lam},
  journal= {arXiv preprint arXiv:2208.08110},
  year   = {2023}
}

备注

Accepted to EACL 2023 (main)