中文

从历史报纸广告中进行多语言事件抽取

计算与语言 2023-05-19 v1 机器学习

摘要

NLP方法可帮助历史学家分析超出人工可行规模的文本材料。然而,开发此类方法面临重大挑战。首先,获取大型带标注的历史数据集十分困难,因为只有领域专家才能可靠地标注它们。其次,大多数现有的现成NLP模型是在现代语言文本上训练的,应用于历史语料时效果显著下降。对于研究较少的任务以及英语以外的语言,这一问题尤为突出。本文在关注历史文本新领域中未被充分探索的事件抽取任务的同时,应对上述挑战。我们引入了一个由早期现代殖民时期报道自行摆脱奴役的 enslaved people 的报纸广告组成的英语、法语和荷兰语多语言新数据集。我们发现:1)即使标注数据稀缺,通过将问题表述为抽取式QA任务并利用现代语言的现有数据集和模型,也能取得令人惊讶的良好结果;2)历史语言的跨语言低资源学习极具挑战性,而将历史数据集机器翻译到所考虑的目标语言,在实践中往往是最佳性能方案。

关键词

引用

@article{arxiv.2305.10928,
  title  = {Multilingual Event Extraction from Historical Newspaper Adverts},
  author = {Nadav Borenstein and Natalia da Silva Perez and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2305.10928},
  year   = {2023}
}

备注

Accepted to the main track of ACL2023