语义框架预测
计算与语言
2021-04-13 v1
摘要
本文提出语义框架预测任务,该任务预测一个正在进行的故事中接下来 10、100 甚至 1,000 个句子中将出现的语义框架。先前的工作聚焦于预测故事的即时未来,例如提前一两句。然而,当小说家撰写长篇故事时,生成少量句子不足以帮助他们获得高层次洞察以发展后续故事。在本文中,我们将长篇故事形式化为“故事块”的序列,其中每个块包含固定数量的句子(例如 10、100 或 200)。这种形式化使我们能够预测超出少数句子范围的后续故事弧。我们使用其中语义框架的词频(TF)来表示故事块,并以每个框架的逆文档频率(IDF)进行归一化。我们在来自 Bookcorpus 的 4,794 本书和来自 CODA-19 的 7,962 篇科学摘要上进行了语义框架预测实验,块大小从 5 到 1,000 个句子不等。结果表明,自动化模型比随机、先验和重放基线能更好地预测后续故事块,表明该任务的可行性。我们还了解到,当块大小超过 150 个句子时,使用框架表示作为特征的模型优于所有现有方法。人工评估也表明,所提出的框架表示在可视化为词云时,对人类而言是可理解、具代表性且具体的。我们的代码可在 https://github.com/appleternity/FrameForecasting 获取。
引用
@article{arxiv.2104.05604,
title = {Semantic Frame Forecast},
author = {Chieh-Yang Huang and Ting-Hao 'Kenneth' Huang},
journal= {arXiv preprint arXiv:2104.05604},
year = {2021}
}
备注
9 pages, NAACL 2021