语言模型在社交媒体中时间泛化的系统分析
计算与语言
2024-05-24 v1 机器学习
摘要
在机器学习中,当训练和测试划分在时间上存在差异时,就会发生时间偏移。对于新闻或社交媒体等流式数据,模型通常在特定时间段的固定语料库上进行训练,由于在线内容的动态性和不断演变,模型可能会过时。本文聚焦于社交媒体,特别是Twitter上的时间偏移。我们提出了统一的评估方案,以评估语言模型(LM)在时间偏移下的性能。LM在不同时间设置下的五个多样化社交媒体NLP任务上进行测试,这揭示了两个重要发现:(i)对于实体聚焦型任务(如命名实体识别或消歧,或仇恨言论检测),在时间偏移下的性能下降在不同模型间保持一致,但在其他任务(即主题和情感分类)中并不显著;(ii)在测试期间持续进行预训练并不能提高LM的时间适应性。
引用
@article{arxiv.2405.13017,
title = {A Systematic Analysis on the Temporal Generalization of Language Models in Social Media},
author = {Asahi Ushio and Jose Camacho-Collados},
journal= {arXiv preprint arXiv:2405.13017},
year = {2024}
}