中文

评估对话摘要模型在自然出现的变体下的鲁棒性

计算与语言 2023-11-16 v1

摘要

对话摘要任务旨在总结长对话的同时保留最显著的信息。现实生活中的对话常包含自然出现的变体(如重复、犹豫),而现有的对话摘要模型在此类对话上性能会下降。在本研究中,我们系统性地利用公开可用数据集考察此类变体对最先进对话摘要模型的影响。为模拟现实变体,我们引入两类扰动:话语级扰动,通过错误和语言变体修改单个话语;以及对话级扰动,添加无信息交换(如重复、问候)。我们沿三个鲁棒性维度进行分析:一致性、显著性和忠实性,它们捕捉摘要模型性能的不同方面。我们发现,微调模型和指令微调模型均受输入变体影响,后者更易受影响,尤其对对话级扰动。我们还通过人工评估验证了发现。最后,我们考察是否可通过用部分扰动数据训练来提升微调模型的鲁棒性,并观察到该方法不足以解决当前模型的鲁棒性挑战,因此需要更深入研究以寻找更好方案。总体而言,我们的工作凸显了对话摘要中的鲁棒性挑战,并为未来研究提供见解。

关键词

引用

@article{arxiv.2311.08705,
  title  = {Evaluating Robustness of Dialogue Summarization Models in the Presence of Naturally Occurring Variations},
  author = {Ankita Gupta and Chulaka Gunasekara and Hui Wan and Jatin Ganhotra and Sachindra Joshi and Marina Danilevsky},
  journal= {arXiv preprint arXiv:2311.08705},
  year   = {2023}
}