通过时序专家平均扩展时序领域泛化
机器学习
2025-10-01 v1 计算与语言
计算机视觉与模式识别
摘要
时序领域泛化(TDG)旨在泛化到跨时间的分布偏移,例如词汇随时间的变化。先前的工作通常通过预测未来的模型权重来解决这个问题。然而,即使对于中等规模的模型,完整的模型预测成本也高得令人望而却步。因此,最近的方法只预测分类器层,由于未能调整其他模型组件而限制了泛化能力。为了解决这个问题,我们提出了时序专家平均(TEA),这是一种新颖且可扩展的时序领域泛化框架,它使用权重平均来更新整个模型,以最大化泛化潜力同时最小化计算成本。我们的理论分析指导我们采取两个步骤来增强对未来领域的泛化。首先,我们通过在约束权重变化的同时,在单个时间领域上微调一个领域无关的基础模型,来创建具有功能多样性但参数相似性的专家模型。其次,我们通过从主成分子空间中建模时序权重轨迹得出的自适应平均系数来优化偏差-方差权衡。专家的贡献基于它们与未来领域的投影接近度。在7个时序领域泛化基准、5个模型和2种时序领域泛化设置上的大量实验表明,TEA的性能比先前的时序领域泛化方法高出多达69%,同时效率提高了多达60倍。
引用
@article{arxiv.2509.26045,
title = {Scaling Up Temporal Domain Generalization via Temporal Experts Averaging},
author = {Aoming Liu and Kevin Miller and Venkatesh Saligrama and Kate Saenko and Boqing Gong and Ser-Nam Lim and Bryan A. Plummer},
journal= {arXiv preprint arXiv:2509.26045},
year = {2025}
}
备注
Accepted by EMNLP 2025 main