中文

讣告中的自动段落识别

计算与语言 2020-03-02 v1

摘要

讣告包含跨越时代与文化的人们价值观的信息,这使其成为探索文化史的有用资源。它们通常结构相似,包含对应于个人信息、生平简介、性格特征、家庭、致谢、悼词、葬礼信息及人物其他方面的段落。为使这些信息可用于进一步研究,我们提出了一种识别这些段落的统计模型。为此,我们从 TheDaily Item、Remembering.CA 和 The London Free Press 收集了 20058 篇英文讣告的语料库。三位标注者在 1008 篇讣告上对我们的标注指南进行评估,显示出 Fleiss k = 0.87 的实质性一致。作为自动分割任务,卷积神经网络以微平均 F1 = 0.81 优于词袋以及基于嵌入的 BiLSTM 和 BiLSTM-CRF。

关键词

引用

@article{arxiv.2002.12699,
  title  = {Automatic Section Recognition in Obituaries},
  author = {Valentino Sabbatino and Laura Bostan and Roman Klinger},
  journal= {arXiv preprint arXiv:2002.12699},
  year   = {2020}
}

备注

9 pages, 1 figure, accepted at LREC 2020