PCC:基于 Bottom-k 采样与循环学习的课程数据增强复述方法
计算与语言
2023-02-01 v3
摘要
课程数据增强(CDA)通过由易到难地呈现合成数据来改进神经模型。然而,传统 CDA 简单地将词扰动比例作为难度度量,并且仅单次遍历课程。本文提出 \textbf{PCC}:基于 Bottom-k 采样与循环学习的课程数据增强 \textbf{P}araphrasing with \textbf{B}ottom-k Sampling and \textbf{C}yclic Learning for \textbf{C}urriculum Data Augmentation,一种通过复述的新型 CDA 框架,其利用文本复述相似度作为课程难度度量。我们提出一个由三个单元组成的课程感知复述生成模块:带 bottom-k 采样的复述候选生成器、过滤机制和难度度量。我们还提出一种多次遍历课程的循环学习策略。bottom-k 采样用于为后续课程生成超难样本。在少样本文本分类以及对话生成上的实验结果表明,PCC 超越了具有竞争力的基线。人工评估与大量案例分析表明,bottom-k 采样能有效生成超难样本,且 PCC 显著改进了基线对话智能体。
引用
@article{arxiv.2208.08110,
title = {PCC: Paraphrasing with Bottom-k Sampling and Cyclic Learning for Curriculum Data Augmentation},
author = {Hongyuan Lu and Wai Lam},
journal= {arXiv preprint arXiv:2208.08110},
year = {2023}
}
备注
Accepted to EACL 2023 (main)