中文

InviTE 语料库:为计算建模标注都铎时期英语文本中的谩骂语

计算与语言 2025-09-29 v1

摘要

本文旨在将自然语言处理(NLP)技术应用于历史研究,特别是研究都铎王朝英格兰宗教改革背景下的宗教谩骂。我们概述了一个从原始数据,经过预处理和数据选择,到迭代标注过程的完整工作流程。作为成果,我们推出了 InviTE 语料库——一个包含近 2000 个近代早期英语(EModE)句子的语料库,这些句子富含专家关于 16 世纪英格兰谩骂语言的标注。随后,我们评估并比较了微调后的基于 BERT 的模型与零样本提示的指令微调大语言模型(LLMs)的性能,结果凸显了在历史数据上预训练并针对谩骂检测进行微调的模型的优越性。

关键词

引用

@article{arxiv.2509.22345,
  title  = {The InviTE Corpus: Annotating Invectives in Tudor English Texts for Computational Modeling},
  author = {Sophie Spliethoff and Sanne Hoeken and Silke Schwandt and Sina Zarrieß and Özge Alaçam},
  journal= {arXiv preprint arXiv:2509.22345},
  year   = {2025}
}