中文

QUDEVAL:讨论下问题语篇解析的评测

计算与语言 2023-11-03 v2

摘要

讨论下问题(QUD)是一种通用的语言学框架,其中语篇通过持续提问与回答而推进。因此,将语篇自动解析以生成QUD结构涉及一项复杂的问题生成任务:给定文档与答句,生成满足QUD语言约束且可基于前文锚定句的问题。已知这类问题由好奇心驱动且开放性强。本工作引入了首个QUD解析自动评测框架,将QUD的理论约束落实为具体协议。我们提出QUDeval,一个对来自微调系统与LLM生成的2190个QUD问题进行细粒度评测的数据集。利用QUDeval,我们表明满足QUD全部约束对现代LLM仍具挑战性,且现有评测指标难以近似解析器质量。令人鼓舞的是,人工撰写的QUD被我们的评测者打出高分,表明在语言建模方面仍有提升空间,以改进QUD解析与QUD评测。

关键词

引用

@article{arxiv.2310.14520,
  title  = {QUDEVAL: The Evaluation of Questions Under Discussion Discourse Parsing},
  author = {Yating Wu and Ritika Mangla and Greg Durrett and Junyi Jessy Li},
  journal= {arXiv preprint arXiv:2310.14520},
  year   = {2023}
}

备注

Camera Ready for EMNLP Main Conference