中文

多文档评论文本的情境融合生成

计算与语言 2024-04-02 v2

摘要

有依据的文本生成,涵盖长文本问答和摘要等任务,既需要内容选择也需要内容整合。当前的端到端方法因其不透明性而难以控制和解释。因此,近期工作提出了一种模块化方法,为每个步骤设置独立组件。具体而言,我们聚焦于第二个子任务,即在多文档设定下,基于预先选定的内容生成连贯文本。具体地,我们将情境融合(Fusion-in-Context, FiC)形式化为一个独立任务,其输入由带有目标内容高亮标记的源文本组成。模型随后需要生成一个连贯段落,包含且仅包含所有目标信息。我们的工作包括在评论领域构建一个包含 1000 个实例的精选数据集,以及一个用于评估高亮忠实度和覆盖度的新颖评估框架,该框架与人类判断高度相关。多个基线模型展现出有前景的结果并提供了深刻的分析。本研究为在多文档设定下进一步探索模块化文本生成奠定了基础,有望提升生成内容的质量和可靠性。我们的基准 FuseReviews,包括数据集、评估框架和指定排行榜,可在 https://fusereviews.github.io/ 找到。

关键词

引用

@article{arxiv.2403.15351,
  title  = {Multi-Review Fusion-in-Context},
  author = {Aviv Slobodkin and Ori Shapira and Ran Levy and Ido Dagan},
  journal= {arXiv preprint arXiv:2403.15351},
  year   = {2024}
}

备注

NAACL 2024, findings