中文

CHRONOBERG:在基础模型中捕捉语言演化与时间感知

计算与语言 2025-09-29 v1 人工智能

摘要

大型语言模型 (LLM) 通过利用社交媒体和从网络爬取的各种数据,在大规模处理方面表现出色。然而,尽管现有语料库具有多样性,其往往缺乏长期时间结构,这可能限制 LLM 将语言的语义和规范性演变语境化以及捕捉历时性变化的能力。为了支持后者的分析与训练,我们引入了 CHRONOBERG,一个跨越 250 年的英语书籍文本时间结构化语料库,精选自 Project Gutenberg 并丰富了各种时间标注。首先,书籍的编辑性质使我们能够通过时间敏感的效价-唤醒度-支配度 (VAD) 分析来量化词汇语义变化,并构建历史校准的情感词典以支持基于时间的解释。借助这些词典,我们证明了现代基于 LLM 的工具需要更好地将其对歧视性语言的检测和情感语境化定位到不同时期。事实上,我们展示了在 CHRONOBERG 上按顺序训练的语言模型如何难以编码意义上的历时性转变,强调了对具备时间感知的训练和评估流程的需求,并将 CHRONOBERG 定位为研究语言变化和时间泛化的可扩展资源。免责声明:本文包含可能冒犯读者的语言和样本展示。开放获取:Chronoberg 在 HuggingFace 上公开可用 ( https://huggingface.co/datasets/spaul25/Chronoberg)。代码可在 (https://github.com/paulsubarna/Chronoberg) 获取。

关键词

引用

@article{arxiv.2509.22360,
  title  = {CHRONOBERG: Capturing Language Evolution and Temporal Awareness in Foundation Models},
  author = {Niharika Hegde and Subarnaduti Paul and Lars Joel-Frey and Manuel Brack and Kristian Kersting and Martin Mundt and Patrick Schramowski},
  journal= {arXiv preprint arXiv:2509.22360},
  year   = {2025}
}