中文

FLAME:关于弗拉米亚人类瞬时经历的新数据集

计算与语言 2026-05-13 v3

摘要

我们介绍 FLAME(FLemish Accounts of Momentary Experiences),一个包含近 25,000 条比利时-荷兰语(弗拉米亚语)日常个人叙事的语料库,旨在支持自然语言处理(NLP)中 underrepresented 语言变体的研究。此类个人叙述蕴含丰富的文化背景与日常主题的提取潜力,但鉴于其非正式语境、文化特异性以及弱资源特性,从中提取有意义主题并非易事。因此我们提出:哪种主题建模方法最适合揭示此语料库中的潜在主题?为此,我们对比评估了三种广泛使用的方法:K 均值聚类、潜在狄利克雷分配(LDA)和 BERTopic,评估其识别连贯性和文化相关性主题的能力。虽然 LDA 在自动连贯性指标上表现出色,但人类评估显示 BERTopic 在持续产生最具连贯性和文化共鸣主题方面始终领先,揭示了纯统计方法在叙事丰富数据上的局限性。K 均值相较于类似荷兰语语料库的先前工作表现下降,进一步凸显了该数据集所面临的独特语言挑战。我们的发现表明,语境嵌入对在弱资源、特定文化领域的主题建模至关重要,强调在人工评估与自动指标之间保持平衡的重要性。

关键词

引用

@article{arxiv.2504.14707,
  title  = {FLAME: A New Dataset on FLemish Accounts of Momentary Experiences},
  author = {Ratna Kandala and Niels Vanhasbroeck and Katie Hoemann},
  journal= {arXiv preprint arXiv:2504.14707},
  year   = {2026}
}