EmailSum:抽取式邮件会话线程摘要
计算与语言
2021-08-02 v1 人工智能
摘要
近年来,总结会话线程(会议、在线讨论等)这一挑战性任务引起了关注。此类摘要有助于分析长文本以快速了解决策,从而提高工作或沟通效率。为推动线程摘要研究,我们构建了抽取式邮件线程摘要(EmailSum)数据集,包含 2549 个邮件线程(每个含 3 至 10 封邮件)、涵盖广泛主题的人工标注短摘要(<30 词)和长摘要(<100 词)。我们开展了全面的实证研究,探索不同摘要技术(包括抽取与生成式方法、单文档与层次化模型,以及迁移与半监督学习),并对短摘要和长摘要生成任务进行人工评估。我们的结果揭示了当前生成式摘要模型在此任务中的关键挑战,例如理解发送者意图和识别发送者与接收者角色。此外,我们发现广泛使用的自动评价指标(ROUGE、BERTScore)在此邮件线程摘要任务中与人工判断相关性较弱。因此,我们强调人工评估的重要性以及社区开发更好指标的必要性。我们的代码与摘要数据已发布于:https://github.com/ZhangShiyue/EmailSum
引用
@article{arxiv.2107.14691,
title = {EmailSum: Abstractive Email Thread Summarization},
author = {Shiyue Zhang and Asli Celikyilmaz and Jianfeng Gao and Mohit Bansal},
journal= {arXiv preprint arXiv:2107.14691},
year = {2021}
}
备注
ACL 2021 (15 pages)