未来有所不同:大型预训练语言模型在预测任务中失效
计算与语言
2022-11-04 v2 人工智能
机器学习
社会与信息网络
摘要
大型预训练语言模型(LPLM)在下游监督任务上微调时取得了惊人的成功。然而,已知当训练所用数据与推理时所用数据之间存在分布偏移时,其性能可能急剧下降。本文关注随时间自然变化的数据分布,并引入四个新的 REDDIT 数据集,即 WALLSTREETBETS、ASKSCIENCE、THE DONALD 和 POLITICS 子版块。首先,我们通过实证表明,当预测主题分布随时间变化的子版块中未来帖子的受欢迎程度时,LPLM 的平均性能下降约 88%(最佳情况下!)。随后我们提出一种简单方法,利用神经变分动态主题模型与注意力机制推断用于回归任务的时间语言模型表示。我们的模型在预测未来帖子受欢迎程度时,最坏情况下性能仅下降约 40%(最佳情况下降 2%),同时仅使用 LPLM 总参数量的约 7%,并提供可解释的表示,从而洞察如 2021 年 GameStop 逼空等真实世界事件。
引用
@article{arxiv.2211.00384,
title = {The future is different: Large pre-trained language models fail in prediction tasks},
author = {Kostadin Cvejoski and Ramsés J. Sánchez and César Ojeda},
journal= {arXiv preprint arXiv:2211.00384},
year = {2022}
}