中文

CONFIT:基于语言信息引导对比微调的忠实对话摘要方法

计算与语言 2023-05-10 v2

摘要

生成摘要中的事实不一致严重限制了抽取式对话摘要的实际应用。尽管利用预训练模型已取得显著进展,但在人工评估中仍发现大量幻觉内容。预训练模型最常通过交叉熵损失进行文本摘要微调,这可能并非最优策略。本工作中,我们提供了一套带有标注数据的事实错误类型体系,以凸显错误类型并摆脱对事实性的二元理解。我们进一步提出了一种通过新颖的对比微调(称为 ConFiT)来提升摘要事实一致性与整体质量的训练策略。基于我们语言信息引导的错误类型体系,我们设计了不同的模块化目标,各自针对特定类型。具体而言,我们利用含错误的难负样本以减少事实不一致的生成。为捕捉说话人之间的关键信息,我们还设计了一种对话专用损失。通过人工评估与自动忠实度指标,我们表明我们的模型在 SAMSum 语料库的对话摘要上显著减少了各类事实错误。此外,我们的模型可泛化至会议摘要 AMI 语料库,并在两个数据集上关于词重叠指标均取得显著高于多数基线模型的分数。

关键词

引用

@article{arxiv.2112.08713,
  title  = {CONFIT: Toward Faithful Dialogue Summarization with Linguistically-Informed Contrastive Fine-tuning},
  author = {Xiangru Tang and Arjun Nair and Borui Wang and Bingyao Wang and Jai Desai and Aaron Wade and Haoran Li and Asli Celikyilmaz and Yashar Mehdad and Dragomir Radev},
  journal= {arXiv preprint arXiv:2112.08713},
  year   = {2023}
}