HistBERT:一种用于历时词汇语义分析的预训练语言模型
计算与语言
2022-02-10 v1 机器学习
摘要
上下文词嵌入已在包括历史语义变化在内的各种自然语言处理任务中展现出最先进的性能。然而,诸如 BERT 之类的语言模型主要是在当代语料数据上训练的。为探究在历史语料上训练是否能改进历时语义分析,我们提出了一种基于 BERT 的预训练语言模型 HistBERT,其在平衡的《美国历史英语语料库》上训练。我们通过比较原始 BERT 与 HistBERT 的性能来检验我们方法的有效性,并报告了在词相似度和语义变迁分析中的 promising 结果。我们的工作表明,上下文嵌入在历时语义分析中的有效性依赖于输入文本的时间分布特征,在应用该方法研究历史语义变化时应当谨慎。
引用
@article{arxiv.2202.03612,
title = {HistBERT: A Pre-trained Language Model for Diachronic Lexical Semantic Analysis},
author = {Wenjun Qiu and Yang Xu},
journal= {arXiv preprint arXiv:2202.03612},
year = {2022}
}