通过插值改进个性化语言建模的策略考察与扩展
计算与语言
2020-06-11 v1 机器学习
摘要
本文详细介绍了用于插值个性化语言模型的新颖策略以及处理集外词(OOV)标记以改进个性化语言模型的方法。利用 Reddit 上的公开数据,我们通过将全局基于 LSTM 的创作模型与用户个性化的 n-gram 模型进行插值,展示了在用户级别离线指标上的改进。通过以均匀 OOV 惩罚和插值系数的退避优化该方法,我们观察到超过 80% 的用户在困惑度上获得提升,每位用户平均困惑度提升 5.2%。在此研究中,我们扩展了先前构建自然语言接口(NLI)的工作,并改进了下游任务指标的鲁棒性。
引用
@article{arxiv.2006.05469,
title = {Examination and Extension of Strategies for Improving Personalized Language Modeling via Interpolation},
author = {Liqun Shao and Sahitya Mantravadi and Tom Manzini and Alejandro Buendia and Manon Knoertzer and Soundar Srinivasan and Chris Quirk},
journal= {arXiv preprint arXiv:2006.05469},
year = {2020}
}
备注
ACL Natural Language Interface Workshop 2020, short paper