中文

英语 RST 解析的难点何在?用于错误分析的预测模型

计算与语言 2023-09-12 v1

摘要

尽管自然语言处理(NLP)近期取得了进展,基于修辞结构理论框架的层次化语篇解析仍然具有挑战性,且我们对其原因的理解目前仍有限。在本文中,我们考察并建模了先前工作中与解析困难相关的一些因素:隐式语篇关系的存在、识别长距离关系的挑战、集外词项等。为了评估这些变量的相对重要性,我们还发布了两个带标注的英语测试集,其中包含与金标准 RST 关系相关联的显式正确与干扰性语篇标记。我们的结果表明,如同在浅层语篇解析中一样,显式/隐式的区分起作用,但长距离依赖是主要挑战,而词汇重叠的缺乏问题较小,至少对于领域内解析而言。我们最终的模型能够以 76.3% 的准确率(自底向上解析器)和 76.6% 的准确率(自顶向下解析器)预测错误将发生的位置。

关键词

引用

@article{arxiv.2309.04940,
  title  = {What's Hard in English RST Parsing? Predictive Models for Error Analysis},
  author = {Yang Janet Liu and Tatsuya Aoyama and Amir Zeldes},
  journal= {arXiv preprint arXiv:2309.04940},
  year   = {2023}
}

备注

SIGDIAL 2023 camera-ready; 12 pages