中文

分布鲁棒语言建模

计算与语言 2019-09-06 v1 机器学习 机器学习

摘要

语言模型通常在跨越广泛主题(例如新闻、评论、小说)的数据上训练,但它们可能被应用于先验未知的目标分布(例如餐厅评论)。在本文中,我们首先表明,在使用标准最大似然(MLE)训练时,在测试分布之外的文本上训练会损害测试性能。为在无测试分布知识的情况下补救此问题,我们提出一种方法,训练一个在广泛潜在测试分布上表现良好的模型。具体而言,我们推导了一种新的分布鲁棒优化(DRO)过程,它最小化模型在具有与训练分布充分重叠的主题的最坏情况混合上的损失。我们的方法称为主题条件风险价值(topic CVaR),当语言模型在 Yelp 评论和新闻的混合上训练并仅在评论上测试时,相较 MLE 获得了 5.5 点的困惑度降低。

关键词

引用

@article{arxiv.1909.02060,
  title  = {Distributionally Robust Language Modeling},
  author = {Yonatan Oren and Shiori Sagawa and Tatsunori B. Hashimoto and Percy Liang},
  journal= {arXiv preprint arXiv:1909.02060},
  year   = {2019}
}

备注

Camera ready version for EMNLP