实体、日期与语言:基于 T0 的历史文本零样本研究
计算与语言
2022-04-12 v1
摘要
在这项工作中,我们探究了近期所展示的 T0 模型的零样本能力是否可扩展到分布外语言和历史时期的命名实体识别。我们使用一个包含 3 种语言的历史报纸语料库作为测试平台,通过提示词来提取可能的命名实体。我们的结果表明,基于提示词的零样本多语言命名实体识别的朴素方法容易出错,但凸显了该方法对于缺乏标注数据集的历史语言的潜力。此外,我们还发现,类似 T0 的模型可被探测以预测文档的出版日期和语言,这对于历史文本研究可能非常有意义。
引用
@article{arxiv.2204.05211,
title = {Entities, Dates, and Languages: Zero-Shot on Historical Texts with T0},
author = {Francesco De Toni and Christopher Akiki and Javier de la Rosa and Clémentine Fourrier and Enrique Manjavacas and Stefan Schweter and Daniel van Strien},
journal= {arXiv preprint arXiv:2204.05211},
year = {2022}
}