中文

探究语料多样性对金融预训练语言模型的影响

计算与语言 2025-05-27 v2

摘要

过去几年中,各种领域特定的预训练语言模型(PLM)被提出,并在生物医学、科学和临床等专门领域超越了通用领域 PLM。此外,由于金融数据分析的高经济影响,金融 PLM 也得到研究。然而,我们发现金融 PLM 并未在足够多样的金融数据上预训练。这种多样训练数据的缺失导致泛化性能不佳,使得包括 BERT 在内的通用 PLM 在许多下游任务上常优于金融 PLM。为解决此问题,我们收集了广泛的金融语料并在这些多样数据集上训练了金融语言模型(FiLM)。实验结果证实 FiLM 不仅超越现有金融 PLM,也超越通用领域 PLM。此外,我们提供了经验证据,表明即便对未见过的语料组也能实现此种改进。

关键词

引用

@article{arxiv.2310.13312,
  title  = {Exploring the Impact of Corpus Diversity on Financial Pretrained Language Models},
  author = {Jaeyoung Choe and Keonwoong Noh and Nayeon Kim and Seyun Ahn and Woohwan Jung},
  journal= {arXiv preprint arXiv:2310.13312},
  year   = {2025}
}

备注

Accepted to EMNLP 2023 (Findings)