中文

面向文本生成的动量校准

计算与语言 2022-12-09 v1 机器学习

摘要

大多数文本生成任务的输入与输出可转化为两个 token 序列,并可使用诸如 Transformer 的序列到序列学习建模工具进行建模。这些模型通常通过最大化输出文本序列的似然来训练,并假设训练时给定输入序列及所有真实前文 token,而在推理时模型面临曝光偏差问题(即其在束搜索时仅能访问先前预测的 token 而非真实 token)。本文中,我们提出用于文本生成的 MoCa(动量校准,{\bf Mo}mentum {\bf Ca}libration)。MoCa 是一种在线方法,利用带动量移动平均生成器与束搜索动态生成缓慢演化(但一致)的样本,并学习将这些样本的模分分数与其实际质量对齐。在四个文本生成数据集(即 CNN/DailyMail、XSum、SAMSum 与 Gigaword)上的实验表明,MoCa 使用常规微调一致地改进了强预训练 Transformer,并且我们在 CNN/DailyMail 与 SAMSum 数据集上取得了最先进的结果。

关键词

引用

@article{arxiv.2212.04257,
  title  = {Momentum Calibration for Text Generation},
  author = {Xingxing Zhang and Yiran Liu and Xun Wang and Pengcheng He and Yang Yu and Si-Qing Chen and Wayne Xiong and Furu Wei},
  journal= {arXiv preprint arXiv:2212.04257},
  year   = {2022}
}