讣告中的自动段落识别
计算与语言
2020-03-02 v1
摘要
讣告包含跨越时代与文化的人们价值观的信息,这使其成为探索文化史的有用资源。它们通常结构相似,包含对应于个人信息、生平简介、性格特征、家庭、致谢、悼词、葬礼信息及人物其他方面的段落。为使这些信息可用于进一步研究,我们提出了一种识别这些段落的统计模型。为此,我们从 TheDaily Item、Remembering.CA 和 The London Free Press 收集了 20058 篇英文讣告的语料库。三位标注者在 1008 篇讣告上对我们的标注指南进行评估,显示出 Fleiss k = 0.87 的实质性一致。作为自动分割任务,卷积神经网络以微平均 F1 = 0.81 优于词袋以及基于嵌入的 BiLSTM 和 BiLSTM-CRF。
引用
@article{arxiv.2002.12699,
title = {Automatic Section Recognition in Obituaries},
author = {Valentino Sabbatino and Laura Bostan and Roman Klinger},
journal= {arXiv preprint arXiv:2002.12699},
year = {2020}
}
备注
9 pages, 1 figure, accepted at LREC 2020