中文

ALBERTI:面向诗歌分析的多语言领域专用语言模型

计算与语言 2023-07-06 v1

摘要

诗歌的计算分析受限于可自动分析和扫描诗歌的工具的匮乏。在多语言环境下,这一问题更加严峻,因为格律与押韵系统仅存在于个别语言中,使得比较研究极具挑战且耗时。在本工作中,我们提出 \textsc{Alberti},首个面向诗歌的多语言预训练大语言模型。通过领域专用预训练(DSP),我们在包含来自12种语言的超过1200万诗行的语料库上进一步训练了多语言 BERT。我们在两项诗歌结构任务上评估了其性能:西班牙语诗节类型分类,以及西班牙语、英语和德语的格律模式预测。在这两项任务中,\textsc{Alberti} 均优于多语言 BERT 及其他同等规模的基于 transformer 的模型,甚至在德语上相比基于规则的系统取得了最先进(state-of-the-art)结果,证明了 DSP 在诗歌领域的可行性与有效性。

关键词

引用

@article{arxiv.2307.01387,
  title  = {ALBERTI, a Multilingual Domain Specific Language Model for Poetry Analysis},
  author = {Javier de la Rosa and Álvaro Pérez Pozo and Salvador Ros and Elena González-Blanco},
  journal= {arXiv preprint arXiv:2307.01387},
  year   = {2023}
}

备注

Accepted for publication at SEPLN 2023: 39th International Conference of the Spanish Society for Natural Language Processing