中文

A Bolu:面向撒丁语即兴诗歌计算分析的结构化数据集

计算与语言 2026-04-22 v1

摘要

自然语言处理 (NLP) 对少数民族语言日益增长的兴趣尚未弥合口头语言遗产保护方面的差距。特别是即兴诗歌——一种基于实时即兴创作和韵律-修辞能力的表演体裁——仍然是计算语言学很大程度上未被探索的领域。这种方法论上的差距需要创建特定的资源来记录和分析即兴诗歌的结构。这就是 A Bolu 产生的背景,它是第一个致力于 cantada logudorese(撒丁语的一种变体)的即兴诗歌结构化语料库。该数据集包含 2,835 个诗节,共计 141,321 个词元。本研究展示了该语料库的架构,并应用结合了描述性统计指标和计算语言学技术的多维分析方法来映射诗歌文本的特征。结果表明,撒丁语即兴诗人的创作具有支持 Parry 和 Lord 程式化理论的重复模式。这一证据不仅为理解口头创造力提供了新视角,也为开发对使用人数较少语言的具体特征更具包容性和敏感性的 NLP 工具做出了重要贡献。

关键词

引用

@article{arxiv.2604.19584,
  title  = {A Bolu: A Structured Dataset for the Computational Analysis of Sardinian Improvisational Poetry},
  author = {Silvio Calderaro and Johanna Monti},
  journal= {arXiv preprint arXiv:2604.19584},
  year   = {2026}
}

备注

Accepted at the DIALRES Workshop, LREC-COLING 2026